PDF OCR、選択できない文字をテキストへ

PDF OCRで、画像として保存されたPDFの文章や表を取り出します。文字が選択できない資料も、認識結果を確認してコピーや別形式での保存へ進められます。

開始

ファイルをアップロード

ドラッグ&ドロップまたはクリックして選択

0/30 · 0 credits · Free: 1 file

PDF OCRの進め方

PDFを開いて文字を選べない場合は、内容が画像になっているか確認します。

1

読み込む:スキャンPDFを追加

対象のPDFをアップロードし、文字が読めるページを選びます。薄い原稿はより鮮明なスキャンを用意します。

2

決める:文字と表の抽出方法を選ぶ

本文を含めて読みたいときはContent extraction、表を整理したいときはTable extractionを選択します。

3

点検する:原稿との違いを確かめる

Process filesを実行し、似た数字、句読点、段落の抜けを原PDFと比較します。

4

使う:文字を別形式に保存

TXTやMarkdownを保存するか文字をコピーします。認識された表はExcelやCSVへ書き出せます。

PDFでも中身が文字とは限らない

紙をスキャンしたPDFは、文章が見えていても画像として保存されていることがあります。

選択できない文章
文字情報がない画像ページでは、通常のコピー操作だけでは文章を取り出せません。
スキャンのかすれ
細い線や濁点が消えていると、認識される文字が変わることがあります。
ページごとの状態差
同じPDFでも、鮮明なページと不鮮明なページが混在する場合があります。
Image 1

画像PDFの内容を再利用する

元資料を見ながら確認し、入力や文書編集の準備を進められます。

文章の転記を減らす
読めた内容をコピーして、メモや編集用の文書へ移せます。
数字を確認する材料
表になった結果を原本と照合し、業務資料への利用を判断できます。
読めない箇所の見直し
認識が難しいページを把握し、再スキャンや原稿確認へ戻れます。

PDF OCRのよくある質問

スキャンPDFを文字として使うための基本事項。