Document Parsingとは何か:文書の骨格をデータへ移す構造化の完全整理

Document Parsingとは、文書を構成する見出しや本文、表、箇条書き、図といった要素を一つずつ判別し、それらが成す階層と読む順序まで復元して、機械がそのまま扱える構造データに変換する作業です。

Document Parsingが必要な理由

文書をテキストにすると骨格が消えます。

生成AIを導入した組織が文書資産をモデルにつなぐとき、最もよく行うのはファイルからテキストを抜き出して投入することです。速く簡単です。問題は、その瞬間に文書が平たくなってしまうことにあります。

見出しだった文と本文が区別されず、表はセルの値の羅列へ散らばり、脚注が本文の真ん中へ割り込みます。返納手続を説明する指針で、国費と道費、残額と利子に分かれた多層の表を文章として展開すれば、どの科目がどの条件に当たるのか分からなくなります。人が文書を理解するときに用いる手がかりの相当部分は文字ではなく配置と階層にあるのに、テキストだけを抜き出せばそれがすべて捨てられます。

Document Parsingはこの骨格を併せて移す作業です。検索と生成の品質がモデルではなくこの段階で決まる理由でもあります。

Document Parsingの正確な定義:OCRと何が違うのか

OCRとDocument Parsing、三つの軸の違い

第一に、対象が異なります。OCRは画像上の文字を対象とします。Document Parsingはページを構成する要素の全体を対象とします。実際の実装で判別する要素を挙げると、見出しと節の見出し、本文、表、図、図表、数式、箇条書きの項目、キャプション、ヘッダー、フッター、脚注、フローチャートにまで及びます。

第二に、目標が異なります。OCRの目標は記載された文字を正確に写し取ることです。Document Parsingの目標は文書と同じ形をしたデータを作り出すことです。したがって成果物も異なります。前者は文字列を出し、後者は階層の生きたマークアップや構造データを出します。

第三に、成果指標が異なります。OCRは文字単位の精度で測ります。Document Parsingは構成要素を漏れなく見つけたか、各要素の位置が合っているか、表の構造が原本と一致するかを分けて測ります。ある公共文書の評価では評価要素302個をすべて検出して検出精度100%を記録し、位置精度も100%でしたが、表構造類似度は79.18%にとどまりました。要素を見つけることと、その内部を復元することが異なる難易度であることを示す数値です。

二つの技術は置き換えの関係にはありません。文字認識が不正確であれば構造をいくらうまく復元しても内容が誤ります。認識の上に構造化を載せる順序が適切です。

業務に投入できるDocument Parsingの6つの条件

実運用に入るDocument Parsingの6つの条件

第一に、要素を漏れなく見つけることです。一つでも取りこぼせば、その部分は以降の検索と活用で存在しない内容になります。検出精度は表の復元精度と分けて確認してください。

第二に、読む順序を正確に定めることです。多段組みで編集された文書や表の中に表が入った構造では人でも順序を迷います。順序が食い違えば文が入り乱れて意味が変わります。

第三に、表を構造そのまま移すことです。結合されたセルと多層のヘッダーが生きていて初めて、値がどの項目に属するかを確認できます。この条件は別途の指標で測る必要があります。

第四に、出力形式を複数提供することです。検索と生成にはマークアップ形式が扱いやすく、業務システムへの入力には構造データが適し、画面表示にはまた別の形式が必要になります。一度分析して複数の成果物を作っておけば、以降の活用方法が変わっても原本を再処理せずに済みます。

第五に、多様な形式を原本のまま受け取ることです。実際の文書資産にはPDFと画像だけがあるのではありません。韓国製ワープロ文書やオフィス文書、表計算、テキストファイルが併せて積み上がっています。変換の過程で構造が失われれば回復する方法がありません。

第六に、各要素の位置を併せて返すことです。構造化された結果が原本のどこから出たかを確認できなければ、検収も根拠の提示も不可能になります。

Document Parsingの実際の適用方法

成果物を先に決めます

設計の最初の決定は何を作り出すかです。検索に使うのか、業務システムに入れるのか、画面に表示するのかによって必要な形式が変わるためです。

実務でよく用いる組み合わせは三つを併せて生成しておく方式です。階層が表現されるマークアップ形式が一つ、プログラムが扱いやすい構造データが一つ、表を正確に表現できる形式が一つです。ある広域自治体の構築事例でも、テキストと表、図に分けたうえで複数の形式と断片、キーワードを併せて作り知識ストレージへ格納する方式で設計されました。

要素の判別と内容の認識を分けます

パイプラインを二段階に分ければ改善がはるかに容易になります。まずページから要素の種類と境界、読む順序を判別し、その後に各要素の内容を認識します。

こう分ければ問題が生じたときに原因を絞れます。表がまるごと抜けていれば要素判別の問題であり、表は取れているのに値が食い違うなら内容認識の問題です。一つにまとめた処理ではこの区別ができず、改善の方向を定めにくくなります。

性能を項目別に分けて見ます

Document Parsingの性能を一つの数値に要約すると実際の状態が隠れます。要素検出と位置精度、テキスト認識、表構造の復元、図の検出をそれぞれ確認してください。

実際の評価事例を見ると、これらの値は互いに異なる動き方をします。ある公共文書群では要素検出と位置精度、図の検出がいずれも100%でテキスト認識が98.8%でしたが、表構造の復元は79.18%でした。別の公共文書群では要素検出100%、本文テキスト99.2%に対し表構造の復元が86%であり、申告様式を対象とした検証では表構造の復元が99%以上と確認されました。文書の性格によってどの項目が足を引っ張るかが変わるという意味です。

国内環境におけるDocument Parsing

韓国の公共と金融の文書資産は、韓国製ワープロ形式で積み上がっている比重が大きくなっています。この形式を原本のまま処理できるかが最初の関門であり、別の形式へ変換する過程で表の結合情報が失われれば後段で回復できません。

文書の構成も条件になります。公文と手引き、法令、報告書が一つのストレージに混在し、それぞれ階層構造が異なります。官公庁様式には多層の表と丸数字の項目番号、記入方法の案内文が表の中に併記されます。表の一マスがデータではなく案内である場合を区別できなければ、構造化の結果が汚染されます。

加えてネットワーク分離環境では、文書の変換から構造化までの全過程が社内網で実行される必要があります。外部の変換サービスを呼び出す構成はこの地点で検討対象から外れます。

よくあるご質問

お勧めしません。テキストだけを抽出すると見出しと本文の区別、表の構造、脚注と本文の関係が失われます。検索品質が低い原因はたいていここにあります。

階層が表現されるマークアップ形式と、プログラムが扱いやすい構造データ、表を正確に表現する形式を併せて生成できます。用途に応じて分けて受け取るほうが適切です。

見出しと節の見出し、本文、表、図、図表、数式、箇条書きの項目、キャプション、ヘッダー、フッター、脚注、フローチャートまで区分します。文書の性格に応じて必要な要素だけを選んでお使いいただけます。

一つの数値ではなく項目別に確認してください。要素検出と位置精度、テキスト認識、表構造の復元が文書の性格によって互いに異なる動き方をします。

可能です。ただし別の形式へ変換する過程で表構造が失われやすいため、原本形式のまま処理できるかをご確認ください。

構造化の結果があれば以降の作業がはるかに容易になります。ただし断片へ分けメタデータを付ける段階が別に必要であるため、前処理の設計も併せてご覧いただくほうが適切です。

可能です。文書の変換から構造化までの全過程を社内網で実行する構成が可能です。

関連用語