途切れた改行を段落にまとめるPDFテキスト抽出ツール
PDFを選ぶと全ページの文字を読み込んで結果欄に表示します。改行を段落にまとめ、必要なページだけをコピーするかTXTで保存してください。
文字を取り出すPDFを1つここにドロップしてください
ファイルはサーバーにアップロードせず、このブラウザ内で読み込みます。
最大50MiB・200ページ・文字情報を含むPDFが対象(スキャン画像の文字認識は行いません)
独自に作成した4ページのサンプルPDFです。1〜3ページにはヘッダーとページ番号があり、4ページ目は図だけです。改行の整理やヘッダー除去を切り替えて結果を比べてみてください。ご自身の文書は上から選択してください。
0 / 0ページ読み込み中
まだ抽出していません。
PDFを選ぶと、全ページのテキストを読み込んで結果欄に表示します。
スキャン画像の中の文字は文字認識(OCR)を行わないため抽出されません。開くパスワードがあるPDFやコピーが制限されたPDFは処理しません。文字の順序はPDFに保存された順序に従うため、段組みや表は行の順序が入れ替わることがあります。TXTはメモ帳やExcelで文字化けしないようUTF-8(BOM付き)で保存します。
すぐ使える形で。
- すぐ見える画面入力場所と結果の場所をはっきり分けます。
- 結果を先に大事な数字を先に出し、過程は必要な分だけ見せます。
- 求めるものを減らす登録や余計な入力なしで使えるようにします。
PDFから文字を取り出して整える方法
PDFテキスト抽出とは、PDFの中に文字として保存されている情報を取り出し、編集できるテキストに移す作業です。PDFビューアーからそのままコピーすると、画面上の行末ごとに改行が入り、文章がぶつ切りになりがちです。このツールはページごとに文字を読み取り、同じ段落の行をつなげたうえで、必要なページだけをコピーしたりTXTファイルに保存したりできます。
対象は文字情報を含むPDFです。Word・Excel・一太郎などからPDFとして書き出した文書や、Webで配布されている報告書がこれにあたります。紙をスキャンして画像だけで作ったPDFは文字認識(OCR)を行わないため文字が出ず、そのページは「テキストのないページ」として別に知らせます。選んだファイルはサーバーに送らず、このブラウザ内で読み込みます。
文字情報を含むPDFかを先に確かめる
見た目は同じPDFでも、文字を文字として持つファイルと、ページを画像として持つファイルがあります。PDFビューアーで文章をドラッグしたときに1文字ずつ選択できれば、文字情報を含むPDFです。ページ全体が1枚の画像として選択される、または何も選択できない場合はスキャンPDFの可能性が高いと考えられます。
このツールにスキャンPDFを入れると、そのページは「テキストなし」と表示されます。表紙だけが画像で本文は文字、という混在した文書も珍しくありません。結果欄の下の案内でテキストのないページ番号を確認し、そのページだけOCR機能のあるソフトで処理すると効率的です。
PDFを選んでTXTを保存するまで
PDFを1つ選ぶかドロップすると、最初のページから最後のページまで文字を一度読み込みます。読み込み中は進行バーにページ数が表示され、終わると選択範囲すべてのテキストが結果欄に出ます。その後に改行やオプションを切り替えても、ファイルを読み直さずにすぐ整理し直します。
個人の文書を入れる前に「サンプルPDFを開く」でオプションの違いを確かめられます。サンプルはヘッダーとページ番号のある3ページと、図だけの1ページでできており、ボタンを押したときだけ開きます。
- PDFを選び、ファイル名・総ページ数・文字のあるページ数を確認します。
- 必要なら抽出するページを入力します。最初は全ページが入っています。
- 改行の扱い、ページ区切り、繰り返すヘッダー・ページ番号の除去、空白の整理を選びます。
- 「表示」で選択範囲すべてか1ページを選んで結果を読みます。1ページを選ぶと元のページが横に表示されます。
- 「すべてコピー」「このページをコピー」「TXT保存」から必要な方法で結果を持ち出します。
「段落にまとめる」と「PDFの行のまま」の違い
PDFには段落という情報がないことが多く、画面に見える1行ずつが位置とともに保存されています。そのためそのままコピーすると行末ごとに改行が入ります。「段落にまとめる」を選ぶと、同じ段落に属する行を1つの文につなげ、段落と段落の間には空行を1つ入れます。
たとえばPDFに「個人情報の収集項目は氏名と」「連絡先です。」が2行で並んでいれば、結果は「個人情報の収集項目は氏名と連絡先です。」になります。日本語は単語の間を空けないので、つなぐときに空白を入れません。「PDFの行のまま」を選ぶと2行のまま残します。住所や詩のように行の位置に意味がある文章は、こちらが向いています。
段落の境目は行と行の縦の間隔で判断します。そのページのふだんの行間より約1.5倍以上あいていれば新しい段落とみなします。文字の大きさが変わる見出し行、次の段へ移って位置が上に戻る行、・や○、①、1. のような記号で始まる行も新しい段落として扱います。
行をつなぐときの空白のルール
ひらがな・カタカナ・漢字どうしがつながる場合は空白を入れずに連結します。日本語の文章が行の途中で折り返されていても、元の一続きの文に戻ります。全角・半角の数字や英字が日本語とつながる場合も空白を入れず、英単語どうしがつながる場合だけ半角スペースを1つ入れます。
英単語が行末のハイフンで分かれている場合、たとえば「exam-」と「ple」は「exam-ple」になります。ハイフンを消して「example」にすると、「well-known」のように元からハイフンがある語まで崩れてしまうため、文字を消さない方を選んでいます。英文の資料を移すときは、行末のハイフンが残った箇所を一度確認してください。
繰り返すヘッダーとページ番号を除く
報告書のページ上部に文書名、下部に「- 3 -」のようなページ番号が毎ページ入っていると、抽出したテキストの途中に同じ行が何度も挟まります。「繰り返すヘッダー・ページ番号の行を除く」をオンにすると、3行以上あるページの最初と最後の行(5行以上のページは上下2行ずつ)を比べ、複数のページで繰り返される行を除きます。1ページの行をすべて消すことはないので、章タイトル1行だけのページはそのまま残ります。
数字だけが違う行は同じ行とみなします。「- 1 -」「- 2 -」や「2026年度報告書 3」「2026年度報告書 4」も繰り返しとして数えます。比較対象のページの60%以上、かつ最低3ページで繰り返される場合だけ除きます。
このオプションは初期状態でオフです。毎ページ上に同じ表の見出し行がある文書のように、本文に必要な行が位置の条件に当てはまると一緒に消える可能性があるためです。オンにすると除いた行数が結果欄の下に表示されるので、数が想定と違えばオフにして比べてください。
必要なページだけを抽出する
「抽出するページ」に2,4-6と入力すると、元の2・4・5・6ページだけが結果に入ります。カンマは離れたページや区間を一緒に選ぶとき、ハイフンは連続した範囲を書くときに使います。6,2の順で書いても結果は元の順序どおり2ページ、6ページの順になり、同じページを2回書いても1回だけ入ります。
番号はPDFの最初のページを1と数える画面上の番号です。文書に印刷されたページ番号とは異なる場合があります。表紙と目次が1ページずつ前にあれば、本文の1ページ目は画面上の3ページです。「表示」で1ページを選び、横の元ページのプレビューで内容を確かめると番号を合わせやすくなります。
ページ区切りの表示とテキストのないページ
「ページ区切りを入れる」がオンなら、各ページのテキストの前に[3ページ]のように元のページ番号が1行入ります。文字のないページは[5ページ・テキストなし]と表示され、どこが空だったかが結果の中ですぐわかります。引用元のページ数を書く必要がある資料整理に便利です。
オフにすると、ページの間に空行を1つ置くだけでつなげ、テキストのないページは結果から外れます。1つの段落が次のページへ続く場合も、ページの境目では空行で分かれます。長文をひとまとまりで移すときは境目を確認し、必要ならつなげてください。
TXT保存と文字化けを防ぐ仕組み
「TXT保存」は結果欄の選択範囲すべてを、元の名前に_textを付けたファイルでダウンロードします。報告書.pdfなら報告書_text.txtです。1ページを表示中でも、保存ファイルには選択範囲すべてが入ります。1ページだけを残したいときは、抽出するページにそのページ番号だけを入力してから保存してください。
ファイルはUTF-8で保存し、先頭にBOM(バイト順マーク)を付けます。古いメモ帳やExcelは、BOMのないUTF-8ファイルをShift_JISとして読み、文字化けすることがありますが、BOMがあればUTF-8として認識します。改行はWindows形式(CR+LF)で保存するので、メモ帳でも行がそのまま分かれ、MacやLinuxのエディターでも読めます。
文字化けや順序の乱れが起きる場合
PDFに見えている文字と抽出される文字が一致しないことがあります。画面表示にはフォントの形があれば足りますが、コピーするには各形がどの文字かを示す情報がPDFの中に必要です。この情報がないPDFは記号や不明な文字になり、そうした文字が多いページは「文字化けの可能性」として知らせます。元のソフトでフォントを埋め込んでPDFを保存し直すと解決することが多いです。
古い日本語PDFで使われるShift_JIS系のフォントエンコーディングは、文字コード表(CMap)ファイルを一緒に読み込んで処理します。縦書きのPDFは、行の順序や改行の位置が本来の読み順と異なる場合があります。
文字の順序はPDFに保存された順序に従います。多くの文書は読む順序と同じですが、2段組みの論文、列の多い表、図中の説明文は行の順序が入れ替わることがあります。表はセルの区切りなしに1行の中で空白でつながるため、そのままExcelの表として貼り付けられる形ではありません。
処理できないPDFと入力の上限
一度に扱えるのはPDF1つ、最大50MiB・200ページです。MiBはファイルサイズの単位で、50MiBは52,428,800バイトです。2つの上限は別々に適用されるので、サイズが小さくても201ページの文書は受け付けません。長い文書はPDF分割ツールで200ページ以下に分けてから順に抽出してください。
開くパスワードがかかったPDFは、パスワード入力機能がないため処理しません。開くときのパスワードはなくても、作成者が文字のコピーを制限しているPDFも処理しません。印刷や編集だけが制限され、コピーは許可されているPDFは通常どおり抽出します。
- 0バイト、またはPDFではないファイル: 元のソフトでPDFとして保存し直してください。拡張子を.pdfに変えただけのファイルは開けません。
- 破損したPDF: ほかのビューアーで開けるか確認し、開けるならそのビューアーのPDF保存機能でコピーを作ります。
- 複数のファイル: 1つずつ入れてください。新しいファイルを入れると前の文書と結果は消去されます。
アップロードしない処理とリセットの範囲
選んだPDFの内容は、抽出のためにサーバーへ送信したり保存したりしません。ファイルの読み込み、テキストの整理、プレビュー、TXTの作成は、いま使っているブラウザ内で行い、会員登録も不要です。ただしページの画面や機能ファイル、広告を読み込む通信は別にあるため、Webページ全体が通信しないという意味ではありません。
「リセット」を押すか別のファイルを入れると、ツール内の文書と結果を消去します。元のPDFや、すでにダウンロードしたTXTは消しません。コピーした内容は端末のクリップボードに残るので、共用のパソコンでは別の文字をコピーして上書きしておくと安心です。
コピー・保存の前に確認したい5つのこと
抽出結果はPDF内の情報を移したもので、元の見た目と完全に同じになるとは限りません。大切な文書では、次の項目を確認してから使ってください。
- 結果欄の下のページ数と文字数が想定に近いかを見ます。文字数が極端に少ないときはテキストのないページがないか確認します。
- テキストのないページ、文字化けの可能性があるページの案内が出ていないかを見ます。
- 2段組みや表のあるページは「表示」で1ページを選び、元のページと順序を比べます。
- 繰り返し行の除去をオンにしたなら、除いた行数を確認し、必要な行が消えていないかを確かめます。
- 数字・日付・金額・固有名詞はもう一度原本と照らし合わせます。保存したTXTは貼り付け先のソフトで開き、文字化けがないか確認します。
よくある質問
スキャンしたPDFを入れたら文字が1つも出てきません。
スキャンPDFはページが画像として保存されていて、取り出せる文字情報がありません。このツールは文字認識(OCR)を行わないため、そのページは「テキストなし」と表示します。OCR機能のあるソフトで文字を認識させたPDFを作ってから入れ直すと抽出できます。
ビューアーからコピーすると1行ずつ途切れます。まとめてつなげられますか?
改行で「段落にまとめる」を選ぶと、同じ段落の行をつなげて1つの文にします。日本語どうしは空白を入れずにつなぎ、段落の間には空行が1つ残ります。行間が不規則な文書では段落の境目がずれることがあるので、結果を読んで必要な箇所を直してください。
保存したTXTをExcelやメモ帳で開くと文字化けします。
このツールはBOM付きのUTF-8で保存するため、多くのソフトはUTF-8として開きます。それでも文字化けする場合は、ソフトの読み込み画面で文字コードをUTF-8に指定してください。別のソフトで一度保存し直したファイルは、そのとき文字コードがShift_JISなどに変わった可能性があります。
表があるPDFはセルごとに分かれて出ますか?
いいえ。表の各行は、セルの間が空白でつながった1行のテキストとして出ます。セルの境目や結合セルの情報は抽出しないので、Excelに貼り付けても表の構造はそのまま再現されません。行の位置を見比べたいときは「PDFの行のまま」を選ぶとわかりやすくなります。
縦書きのPDFも正しい順序で抽出できますか?
縦書きの文字も抽出はできますが、行の順序や改行の位置が本来の読み順と異なる場合があります。「表示」で該当ページを選び、元のページのプレビューと比べて確認してください。順序が崩れる場合は「PDFの行のまま」にすると、元の行単位で見比べやすくなります。
コピー禁止のPDFはなぜ抽出できないのですか?
PDFの作成者が文字のコピーを許可しない権限を設定している文書だからです。このツールはその設定を回避しません。印刷や編集だけが制限され、コピーは許可されているPDFは抽出できます。必要な場合は作成者にコピー制限のないファイルを依頼してください。
200ページを超えるPDFはどう抽出すればいいですか?
一度に処理できるのは200ページまでです。PDF分割ツールで200ページ以下に分け、ファイルごとに抽出して結果を順につなげてください。ページ区切りを入れると、表示される番号は分割後のファイル内の番号なので、元のページ番号とずれる点に注意してください。
ヘッダー除去をオンにしてもヘッダーが残ります。
比較できるページが3ページ未満の場合や、ヘッダーの文言が数字以外もページごとに違う場合は、繰り返し行とみなしません。ヘッダーが各ページの最初や最後の行の位置に保存されていないPDFも除かれません。その場合は結果から手作業で消してください。
結果欄で直接内容を修正できますか?
結果欄は読み取り専用です。画面の内容と、保存・コピーされる内容を常に一致させるためです。コピーするかTXTで保存したあと、メモ帳やWordなどのエディターで修正してください。
全角・半角の英数字や記号は変換されますか?
全角と半角をそろえる変換はこのツールの機能にはありません。基本的にはPDFに保存された文字を出力しますが、PDFの文字情報の持ち方によっては表記が変わる場合があります。行う整理は、分解されて保存された文字を1文字にまとめる正規化、fiのような合字を通常の2文字に戻す処理、見えない制御文字の除去です。表記をそろえたい場合は、抽出後にエディターの置換機能を使ってください。