끊긴 줄을 문단으로 이어 주는 PDF 텍스트 추출기
PDF를 고르면 모든 쪽의 글자를 읽어 결과창에 보여 줍니다. 줄바꿈을 문단으로 정리하고 필요한 쪽만 골라 복사하거나 TXT로 저장하세요.
글자를 꺼낼 PDF 한 개를 여기에 놓으세요
파일 내용은 서버에 올리지 않고 이 브라우저에서 읽습니다.
최대 50MiB · 200쪽 · 글자가 들어 있는 PDF 대상(스캔 이미지는 문자 인식을 하지 않습니다)
직접 만든 4쪽 예시 PDF입니다. 1~3쪽에는 머리글과 쪽 번호가 있고 4쪽은 그림만 있습니다. 줄바꿈 정리와 머리글 제거를 바꿔 보며 결과를 비교해 보세요. 본인 문서는 위에서 선택하세요.
0 / 0쪽 읽는 중
추출 전입니다.
PDF를 선택하면 모든 쪽의 텍스트를 읽은 뒤 결과창에 보여 줍니다.
스캔 사진 속 글자는 문자 인식(OCR)을 하지 않아 추출되지 않습니다. 열기 암호가 있거나 복사가 제한된 PDF는 처리하지 않습니다. 글자 순서는 PDF에 저장된 순서를 따르므로 다단·표는 줄 순서가 섞일 수 있습니다. TXT는 한글 프로그램과 메모장에서 깨지지 않도록 UTF-8(BOM 포함)로 저장합니다.
바로 쓸 수 있게.
- 바로 보이는 화면입력 위치와 결과 위치를 또렷하게 둡니다.
- 결과 먼저핵심 결과를 앞에 두고, 과정은 필요할 때만 보여줍니다.
- 요구 줄이기가입이나 불필요한 정보 입력 없이 바로 쓰게 합니다.
PDF에서 글자를 꺼내 정리하는 방법
PDF 텍스트 추출은 PDF 안에 문자로 저장된 글자를 꺼내 편집할 수 있는 텍스트로 옮기는 작업입니다. PDF 뷰어에서 바로 복사하면 화면의 줄 끝마다 줄바꿈이 들어가 문장이 토막 나기 쉽습니다. 이 도구는 쪽별로 글자를 읽은 뒤 같은 문단의 줄을 이어 붙이고, 필요한 쪽만 골라 복사하거나 TXT 파일로 저장하게 해 줍니다.
대상은 글자가 들어 있는 PDF입니다. 워드·한글·엑셀에서 PDF로 저장한 문서나 웹에서 내려받은 보고서가 여기에 해당합니다. 종이를 스캔해 사진으로만 만든 PDF는 문자 인식(OCR)을 하지 않으므로 글자가 나오지 않으며, 그런 쪽은 텍스트 없는 쪽으로 따로 알려 줍니다. 선택한 파일은 서버에 올리지 않고 현재 브라우저에서 읽습니다.
글자가 들어 있는 PDF인지 먼저 확인하기
같은 PDF라도 글자를 문자로 담은 파일과 페이지를 사진으로 담은 파일이 있습니다. PDF 뷰어에서 문장을 마우스로 끌었을 때 글자 단위로 파랗게 선택되면 문자로 저장된 PDF입니다. 페이지 전체가 한 장의 그림처럼 선택되거나 아무것도 선택되지 않으면 스캔 PDF일 가능성이 큽니다.
이 도구에 스캔 PDF를 넣으면 해당 쪽이 텍스트 없음으로 표시됩니다. 표지만 그림이고 본문은 문자인 문서처럼 두 종류가 섞인 경우도 많습니다. 결과창 아래 안내에서 텍스트 없는 쪽 번호를 확인하고, 그 쪽만 별도 OCR 프로그램으로 처리하면 됩니다.
PDF를 넣고 텍스트를 저장하기까지
PDF 한 개를 선택하거나 끌어 놓으면 첫 쪽부터 마지막 쪽까지 글자를 한 번 읽습니다. 읽는 동안에는 진행 막대에 쪽수가 표시되고, 끝나면 선택 범위 전체의 텍스트가 결과창에 나타납니다. 이후 줄바꿈이나 옵션을 바꾸면 파일을 다시 읽지 않고 바로 다시 정리합니다.
개인 문서를 넣기 전에는 예시 PDF 열기로 옵션의 차이를 먼저 볼 수 있습니다. 예시는 머리글과 쪽 번호가 있는 세 쪽의 본문과 글자 없이 그림만 있는 한 쪽으로 구성되어 있으며, 버튼을 눌렀을 때만 엽니다.
- PDF를 선택하고 파일명·전체 페이지·글자 있는 쪽 수를 확인합니다.
- 필요하면 추출할 페이지를 입력합니다. 처음에는 모든 쪽이 들어 있습니다.
- 줄바꿈 방식과 쪽 구분 표시, 반복 머리글·쪽 번호 빼기, 공백 정리를 고릅니다.
- 보기에서 선택 범위 전체나 한 쪽을 골라 결과를 읽어 봅니다. 한 쪽을 고르면 원본 페이지가 옆에 함께 나옵니다.
- 전체 복사, 이 쪽 복사, TXT 저장 중 필요한 방법으로 결과를 가져갑니다.
문단으로 정리와 PDF 줄 그대로의 차이
PDF에는 문단이라는 정보가 따로 없는 경우가 많습니다. 화면에 보이는 한 줄 한 줄이 위치와 함께 저장되어 있어서, 그대로 복사하면 줄 끝마다 줄바꿈이 생깁니다. 문단으로 정리를 고르면 같은 문단에 속한 줄을 한 문장으로 잇고, 문단과 문단 사이에는 빈 줄 하나를 넣습니다.
예를 들어 PDF에 "개인정보 수집 항목은 성명과"와 "연락처입니다."가 두 줄로 놓여 있으면 결과는 "개인정보 수집 항목은 성명과 연락처입니다."가 됩니다. PDF 줄 그대로를 고르면 두 줄을 원래대로 둡니다. 시나 주소처럼 줄 위치 자체가 의미 있는 글, 줄 단위로 비교해야 하는 목록은 PDF 줄 그대로가 알맞습니다.
문단의 경계는 줄 사이의 세로 간격으로 판단합니다. 그 쪽의 평소 줄 간격보다 약 1.5배 넘게 벌어지면 새 문단으로 봅니다. 글자 크기가 달라지는 제목 줄, 다음 단으로 넘어가며 위치가 위로 올라가는 줄, ○·□·①·1.·가. 같은 목록 기호로 시작하는 줄도 새 문단으로 시작합니다.
줄을 이을 때 띄어쓰기를 정하는 규칙
한글 문서는 보통 어절 단위로 줄이 바뀌므로 두 줄을 이을 때 공백 하나를 넣습니다. 한자·일본어 가나처럼 띄어 쓰지 않는 문자끼리 이어질 때는 공백 없이 붙입니다. 영어 문장도 공백 하나로 잇습니다.
영어 단어가 줄 끝의 붙임표로 나뉜 경우, 예를 들어 "exam-"과 "ple"이 두 줄에 있으면 결과는 "exam-ple"입니다. 붙임표를 지워 "example"로 만들면 "well-known"처럼 원래 붙임표가 있는 낱말까지 망가질 수 있어서, 글자를 지우지 않는 쪽을 택했습니다. 영어 논문을 옮길 때는 줄 끝 붙임표가 남은 곳을 찾아 한 번 확인하세요.
한글 프로그램에서 글자 단위 줄나눔을 쓴 문서는 낱말 중간에서 줄이 바뀌었을 수 있습니다. 이런 PDF는 이어 붙인 자리에 "정 리"처럼 불필요한 공백이 생길 수 있으므로 결과를 읽어 보고 고쳐 쓰세요.
반복되는 머리글과 쪽 번호 빼기
보고서의 맨 위에 문서 제목이, 맨 아래에 "- 3 -" 같은 쪽 번호가 매 쪽 반복되면 추출한 텍스트 중간중간에 같은 줄이 끼어듭니다. 반복 머리글·쪽 번호 줄 빼기를 켜면 세 줄 이상인 쪽의 첫 줄과 마지막 줄(다섯 줄 이상인 쪽은 위아래 두 줄씩)을 비교해 여러 쪽에서 되풀이되는 줄을 뺍니다. 한 쪽의 줄을 모두 빼지는 않으므로, 장 제목 한 줄만 있는 쪽은 그대로 남습니다.
숫자만 다른 줄은 같은 줄로 봅니다. 그래서 "- 1 -", "- 2 -", "- 3 -"이나 "2026년 보고서 3쪽", "2026년 보고서 4쪽"도 반복 줄로 셉니다. 비교 대상인 쪽의 60% 이상, 그리고 최소 세 쪽에서 반복되어야 뺍니다. 비교 대상이 두 쪽 이하이면 아무 줄도 빼지 않습니다.
이 옵션은 기본으로 꺼져 있습니다. 매 쪽 위에 같은 표 제목 행이 반복되는 문서처럼 본문에 필요한 줄이 위치 조건에 걸리면 함께 빠질 수 있기 때문입니다. 옵션을 켜면 몇 줄을 뺐는지 결과창 아래에 표시되니, 개수가 예상과 다르면 끄고 비교해 보세요.
필요한 쪽만 골라 추출하기
추출할 페이지 칸에 2,4-6을 적으면 원본의 2·4·5·6쪽만 결과에 들어갑니다. 쉼표는 떨어진 쪽이나 구간을 함께 고를 때, 붙임표는 연속된 범위를 적을 때 씁니다. 순서를 6,2로 적어도 결과는 원본 순서인 2쪽, 6쪽 순으로 나오며 같은 쪽을 두 번 적어도 한 번만 들어갑니다.
번호는 PDF의 첫 페이지를 1로 세는 화면 번호입니다. 문서에 인쇄된 쪽 번호와 다를 수 있습니다. 표지와 목차가 한 쪽씩 앞에 있으면 본문 1쪽은 화면의 3쪽입니다. 보기에서 한 쪽을 골라 옆의 원본 미리보기로 내용을 확인하면 번호를 맞추기 쉽습니다.
한 쪽만 필요하면 범위를 바꾸지 않고 보기에서 그 쪽을 고른 뒤 이 쪽 복사를 눌러도 됩니다. 이전·다음 버튼으로 선택 범위 안의 쪽을 차례로 넘길 수 있습니다.
쪽 구분 표시와 텍스트 없는 쪽
쪽 구분 표시 넣기가 켜져 있으면 각 쪽의 텍스트 앞에 [3쪽]처럼 원본 쪽 번호가 한 줄로 들어갑니다. 글자가 없는 쪽은 [5쪽 · 텍스트 없음]으로 표시되어 어느 쪽이 비었는지 결과 안에서 바로 알 수 있습니다. 인용할 때 출처 쪽수를 적어야 하는 자료 정리에 편합니다.
표시를 끄면 쪽 사이에 빈 줄 하나만 두고 이어서 적으며, 텍스트 없는 쪽은 결과에서 빠집니다. 한 문단이 다음 쪽으로 넘어가는 경우에도 쪽 경계에서는 빈 줄로 나뉩니다. 긴 글을 한 덩어리로 옮길 때는 쪽 경계를 확인해 필요하면 이어 붙이세요.
TXT 저장과 한글 프로그램에서 열기
TXT 저장은 결과창의 선택 범위 전체를 원본 이름에 _text를 붙인 파일로 내려받습니다. 보고서.pdf라면 보고서_text.txt가 됩니다. 한 쪽을 보고 있어도 저장 파일에는 선택 범위 전체가 들어갑니다. 한 쪽만 파일로 남기려면 추출할 페이지에 그 쪽 번호만 적은 뒤 저장하세요.
파일은 UTF-8로 저장하고 맨 앞에 바이트 순서 표식(BOM)을 붙입니다. 한글 프로그램, 오래된 윈도우 메모장, 엑셀은 BOM이 없는 UTF-8 파일을 한국어 옛 인코딩으로 잘못 열어 글자가 깨질 수 있는데, BOM이 있으면 UTF-8로 알아봅니다. 줄바꿈은 윈도우 방식(CR+LF)으로 저장해 메모장과 한글 프로그램에서 줄이 그대로 나뉘며, 맥과 리눅스의 편집기도 이 줄바꿈을 읽습니다.
글자가 깨지거나 순서가 섞이는 경우
PDF에 보이는 글자와 추출되는 글자는 다를 수 있습니다. 화면에는 글꼴 모양만 있으면 되지만, 복사하려면 각 모양이 어떤 문자인지 알려 주는 정보가 PDF 안에 있어야 합니다. 이 정보가 빠진 PDF는 기호나 알 수 없는 문자로 나오며, 이런 문자가 많은 쪽은 글자 깨짐 의심으로 알려 줍니다. 원본 프로그램에서 글꼴을 포함해 PDF로 다시 저장하면 해결되는 경우가 많습니다.
오래된 한국어 PDF가 쓰는 KS 계열 글꼴 인코딩은 문자표 파일을 함께 불러와 읽습니다. 맥에서 만든 PDF에서 한글이 ㅎㅏㄴ처럼 자모로 나뉘어 나오는 문제는 결과를 한 글자로 합치는 정규화로 바로잡고, fi 같은 영문 합자도 보통 글자 두 개로 풀어 적습니다.
글자 순서는 PDF에 저장된 순서를 따릅니다. 대부분의 문서는 읽는 순서와 같지만, 두 단으로 된 논문이나 칸이 많은 표, 그림 속 설명문은 줄 순서가 섞일 수 있습니다. 표는 칸 경계 없이 한 줄에 공백으로 이어지므로 엑셀 표로 바로 붙여 넣을 수 있는 구조는 아닙니다.
처리할 수 없는 PDF와 입력 한도
한 번에 PDF 한 개, 최대 50MiB·200쪽까지 처리합니다. MiB는 파일 용량 단위로, 50MiB는 52,428,800바이트입니다. 두 한도를 따로 적용하므로 용량이 작아도 201쪽 문서는 받지 않습니다. 긴 문서는 PDF 분할로 200쪽 이하로 나눈 뒤 차례로 추출하세요.
열기 암호가 걸린 PDF는 암호 입력 기능이 없어 처리하지 않습니다. 열 때 암호는 없지만 작성자가 글자 복사를 제한한 PDF도 거절합니다. 인쇄·편집만 제한되고 복사는 허용된 PDF는 정상적으로 추출합니다.
- 0바이트이거나 PDF가 아닌 파일: 원본 프로그램에서 PDF로 다시 저장합니다. 확장자만 .pdf로 바꾼 파일은 열리지 않습니다.
- 손상된 PDF: 다른 뷰어에서 열리는지 확인하고, 열리면 그 뷰어의 PDF로 저장 기능으로 사본을 만듭니다.
- 파일 여러 개: 한 번에 하나씩 넣습니다. 새 파일을 넣으면 이전 문서와 결과는 비워집니다.
파일을 올리지 않는 처리와 초기화
선택한 PDF의 내용은 추출을 위해 서버로 보내거나 저장하지 않습니다. 파일 읽기, 텍스트 정리, 미리보기, TXT 만들기는 현재 브라우저에서 진행하며 회원가입도 필요 없습니다. 페이지 화면과 기능 파일, 광고를 불러오는 통신은 따로 있으므로 웹페이지 전체가 통신하지 않는다는 뜻은 아닙니다.
초기화를 누르거나 다른 파일을 넣으면 도구 안의 문서와 결과를 비웁니다. 원본 PDF나 이미 내려받은 TXT 파일을 지우지는 않습니다. 복사한 내용은 기기의 클립보드에 남아 있으므로 공용 컴퓨터에서는 다른 글을 복사해 덮어 두는 편이 안전합니다.
복사·저장 전에 확인할 다섯 가지
추출 결과는 PDF 안에 저장된 정보를 옮긴 것이어서 원본과 똑같은 모양을 보장하지 않습니다. 중요한 문서라면 아래 항목을 확인한 뒤 사용하세요.
- 결과창 아래의 쪽수와 글자 수가 예상과 비슷한지 봅니다. 글자 수가 유난히 적으면 텍스트 없는 쪽이 있는지 확인합니다.
- 텍스트 없는 쪽, 글자 깨짐 의심 쪽 안내가 있는지 봅니다.
- 두 단 문서나 표가 있는 쪽은 보기에서 한 쪽을 골라 원본과 순서를 비교합니다.
- 반복 줄 빼기를 켰다면 뺀 줄 수를 확인하고, 필요한 줄이 빠지지 않았는지 살핍니다.
- 숫자·날짜·금액·고유명사는 원본과 한 번 더 대조합니다. 저장한 TXT는 붙여 넣을 프로그램에서 열어 글자가 깨지지 않았는지 확인합니다.
자주 묻는 질문
스캔한 PDF를 넣었더니 글자가 하나도 나오지 않아요.
스캔 PDF는 페이지가 사진으로 저장되어 있어 꺼낼 문자 정보가 없습니다. 이 도구는 문자 인식(OCR)을 하지 않으므로 그런 쪽은 텍스트 없음으로 표시합니다. OCR 기능이 있는 프로그램으로 글자를 인식시킨 PDF를 만든 뒤 다시 넣으면 추출할 수 있습니다.
뷰어에서 복사하면 줄마다 끊기는데, 한 번에 이어 붙일 수 있나요?
줄바꿈에서 문단으로 정리를 고르면 같은 문단의 줄을 공백 하나로 이어 한 문장으로 만듭니다. 문단 사이에는 빈 줄 하나가 남습니다. 줄 간격이 불규칙한 문서는 문단 경계가 어긋날 수 있으니 결과를 읽어 보고 필요한 곳을 고치세요.
저장한 TXT를 한글 프로그램에서 열었더니 글자가 깨져요.
이 도구는 한글 프로그램이 UTF-8로 알아보도록 BOM을 붙여 저장합니다. 그래도 깨진다면 불러오기 창에서 문자 코드를 UTF-8로 직접 고르세요. 파일을 다른 프로그램에서 한 번 저장했다면 그 과정에서 인코딩이 바뀌었을 수 있습니다.
표가 있는 PDF는 칸별로 나뉘어 나오나요?
아니요. 표의 각 줄은 칸 사이가 공백으로 이어진 한 줄 텍스트로 나옵니다. 칸 경계나 병합된 셀 정보는 추출하지 않으므로 엑셀에 붙여 넣어도 표 구조가 그대로 살아나지 않습니다. 줄 위치를 보려면 PDF 줄 그대로를 고르면 비교하기 쉽습니다.
두 단으로 된 논문도 순서대로 나오나요?
대부분은 PDF에 저장된 순서가 왼쪽 단, 오른쪽 단 순이어서 그대로 나옵니다. 다만 만든 프로그램에 따라 줄이 번갈아 저장된 PDF는 순서가 섞입니다. 보기에서 해당 쪽을 골라 원본 미리보기와 비교해 확인하세요.
복사 방지가 걸린 PDF는 왜 추출이 안 되나요?
PDF 작성자가 글자 복사를 허용하지 않도록 권한을 설정한 문서이기 때문입니다. 이 도구는 그 설정을 우회하지 않습니다. 인쇄·편집만 제한되고 복사는 허용된 PDF는 추출할 수 있습니다. 필요하다면 작성자에게 복사 제한이 없는 사본을 요청하세요.
200쪽이 넘는 PDF는 어떻게 추출하나요?
한 번에 200쪽까지 처리합니다. PDF 분할 도구에서 200쪽 이하씩 나눈 뒤 파일마다 추출하고, 결과를 차례로 붙이세요. 쪽 구분 표시를 켜면 표시되는 번호는 나눈 파일 안의 번호이므로 원래 쪽수와 다를 수 있습니다.
반복 머리글 빼기를 켰는데 머리글이 그대로 남아요.
선택한 쪽이 세 쪽 미만이거나, 머리글이 쪽마다 숫자 외의 글자까지 다르면 반복 줄로 보지 않습니다. 머리글이 각 쪽의 맨 위·아래 줄 위치가 아닌 곳에 저장된 PDF도 빠지지 않습니다. 이런 경우는 결과에서 직접 지워야 합니다.
결과창에서 바로 내용을 고칠 수 있나요?
결과창은 읽기 전용입니다. 화면의 내용과 저장·복사되는 내용이 항상 같도록 하기 위해서입니다. 복사하거나 TXT로 저장한 뒤 메모장·한글·워드 같은 편집기에서 고치세요.
한글이 ㅎㅏㄴ처럼 자모로 떨어져서 나와요.
맥에서 만든 일부 PDF는 한글을 자모를 나눈 형태로 저장합니다. 이 도구는 결과를 완성형 글자로 합치는 정규화를 적용하므로 보통 한 글자로 나옵니다. 그래도 떨어져 보인다면 PDF가 자모를 서로 다른 위치의 별개 글자로 저장한 경우라서, 원본 프로그램에서 다시 저장한 PDF로 시도해 보세요.