PDF構造解析、文書のまとまりを取り出す

PDF構造解析で、見出しに続く本文や表を読み直せる内容へ整理します。段組みの文章や表の前後関係を確認し、Markdownなどで資料を再利用できます。

開始

ファイルをアップロード

ドラッグ&ドロップまたはクリックして選択

0/30 · 0 credits · Free: 1 file

PDF構造解析の進め方

本文を追える形にしたい場合は、数値だけでなく見出しや注記のあるページも含めます。

1

読み込む:対象の章を選ぶ

PDFをアップロードし、必要な章と、その内容を説明する見出しや表注のページを選択します。

2

選ぶ:文書全体の内容を抽出

Content extractionを選び、Markdown textを有効にして見出しやリストを含む文章を取り出します。

3

たどる:文章の順序を確認

Process filesを押し、段組みの続き、表の位置、見出しと段落のつながりを原本と見比べます。

4

書き出す:内容を再編集へ渡す

MarkdownやJSONを保存します。順序の調整や不要な柱の除去は出力後に行います。

コピーした文字の順序が合わない

PDFの見た目を読む順序と、取り出した文字の並びは一致しないことがあります。

段組みの混在
左右の段落が交互になると、文章の意味を追いにくくなります。
柱やページ番号
本文の途中に繰り返す見出しや数字が入っていないか確認が必要です。
表と説明の分離
表の数値だけでは、対象期間や注記の条件が分からなくなる場合があります。
Image 1

資料の再利用を始めやすく

見た目の再現より、内容を理解して使うための下準備を進めます。

文書編集の材料
段落を取り出してから、手元のエディターで読み順を整えられます。
見出しごとの整理
抽出された階層を確認し、章別のメモや説明資料へ再構成できます。
表の文脈を残す
本文と表題を合わせて読み、数値の条件を確かめて利用できます。

PDF構造解析のよくある質問

読み順や書式の違いを踏まえて結果を使うための質問。