文書分類とは何か:結合されたファイルを業務単位に分ける最初の関門の完全整理
文書分類(Document Classification)とは、受け付けたファイルがどの様式かを判別し、複数の書類が一つにまとまって届いた場合には文書単位に切り分けたうえで、それぞれに種別を付与して以降の処理へ引き渡す処理です。
文書分類が必要な理由
ファイル一つが書類一枚ではありません。
文書の自動化を検討する際、議論の大半は認識精度から始まります。ところが実際の受付箱を開けると、その前に別の問題があります。ファクスで届いたファイル一つに申請書と身分証の写し、通帳の写し、確認書が順序なく continuous に貼り合わされています。担当者はまずこのファイルを開き、どこまでが申請書でどこからが通帳の写しかを目で分けたうえで、ようやく値を読み始めます。ある金融機関の実測では、この確認と分類の作業だけで一件あたり2分から4分が費やされていました。
認識モデルがどれほど正確でも、この段階がなければ自動化は始まりません。どの様式か分からない状態では、何を抽出すべきかも定まらないからです。文書分類は自動化の付属機能ではなく入口です。
文書分類の正確な定義:文書認識と何が違うのか
認識と分類、三つの軸の違い
第一に、対象が異なります。認識はページ内の文字と表を対象とします。分類はページ同士の境界と、ページ全体が与える印象を対象とします。ロゴや様式の表題、表の配置、印刷された案内文のように値ではない要素がかえって判断の根拠になります。
第二に、目標が異なります。認識の目標は記載された内容を正確に写し取ることです。分類の目標はこのファイルを何個の文書に分け、それぞれにどの種別を付けるかを定めることです。同じページを前にして、認識は何が書かれているかに答え、分類はこれが何の書類かに答えます。
第三に、成果指標が異なります。認識は文字精度や項目精度で測ります。分類は種別の判定が正しかったかを基準に測り、実際の検証では文書種別の分類精度が97%水準と確認された金融事例と、89.1%と確認された公共事例が併存します。種別体系の細かさと様式間の類似度によってこの値が大きく変わるという意味です。
二つの処理は置き換えの関係にはありません。分類の結果が誤っていれば、その後の抽出は誤った項目表を手に持って始まるため、認識が正確なほど誤りがもっともらしくなります。順序を守るほうが安全です。
業務に投入できる文書分類の5つの条件
実運用に入る文書分類の5つの条件
第一に、文書の境界を自ら見つけることです。複数の書類が一つのPDFに結合されて届く環境では、種別を判定する前にファイルを断片へ分ける作業が先になります。ページごとに種別を付ける方式では複数枚の書類が一枚ずつ散らばるため、連続したページが同じ文書に属するかを判断する能力が併せて必要です。
第二に、種別の体系を業務基準で設計することです。あるカード金融機関の自動化では、初期文書群46種を整理したうえで747個の分類コード体系をまず構築し、抽出の段階へ進みました。コード体系が粗すぎれば異なる様式が一つの種別にまとめられて抽出項目がずれ、細かすぎれば判定の難易度が上がって精度が落ちます。
第三に、似た形の様式を区別することです。新規加入申請書と情報変更申請書のように、レイアウトがほぼ同じで表題の数文字だけが異なる様式が実際の業務には多くあります。全体の印象だけで判定するとこうした組で誤りが集中するため、表題や文書番号のような決定的な手がかりを併せて確認する設計が必要です。
第四に、改定された様式に対応することです。官公庁と金融の様式は定期的に改定されます。新しい様式が届くたびにモデルを再学習させる構造であれば運用負担が積み上がり続けます。種別の定義をデータとして管理し、変更履歴をバージョンとして残す方式が維持費用を下げます。
第五に、判定できなかった案件を切り分けることです。すべてのファイルを何らかの種別へ無理に分類すれば、誤りが静かに後工程へ流れます。確信の低い案件は未分類のまま残し、担当者の検討対象へ回す流れがあって初めて自動化全体の信頼性が保たれます。
文書分類の実際の適用方法
受付経路までさかのぼって設計します
分類の設計はモデルではなく受付経路から始まります。電子ファクスで届くのか、営業店でスキャンされるのか、携帯端末の撮影分が上がってくるのかによって、ファイルの状態が全く異なるためです。
実際の運用の流れを見ると、電子ファクスの受付、結合PDFの分割、文書分類、項目抽出、後処理、検証、文書管理システムへの格納、自動化ツールとの連携、基幹系への登録という順序でつながります。分類はこの連鎖の三番目の環であり、ここで誤って判定された案件は後続のすべての段階を通過しながら誤りを大きくします。したがって分類の結果を検収画面で確認し修正できる運用環境を併せて準備するほうが安全です。
分類と抽出を分けて構成します
分類と抽出を一つの処理にまとめると、様式が一つ追加されるたびに全体を作り直すことになります。二つの段階を分けておけば、分類の体系は種別の定義だけを修正し、抽出は種別ごとの項目スキーマだけを修正して対応できます。
技術方式で見ると、文書全体の視覚情報と文脈を併せて解釈するモデルが有利です。規則で特定の位置の表題を読んで判定する方式は、スキャンの角度がずれたり上部が切れた文書で即座に失敗します。実際の受付文書では、スキャン時に折れた上部の黒い帯が様式の表題を飲み込んだ事例まで現れます。
分類コード体系を文書として管理します
分類の体系はモデルの中に隠しておくものではなく、担当者が読んで修正できる文書として管理する必要があります。種別が数百個規模に増えると、どのコードがどの様式を指すかがそのまま業務知識になるためです。
管理文書にはコードごとに様式名と発給機関、代表的な例示ファイル、そしてこの種別から抽出する項目の一覧を併せて記します。似た様式があれば何によって区別するかも明示します。この文書があれば担当者が交代しても体系が保たれ、新しい様式が届いたときに既存の種別へ入れるか新設するかを判断する根拠が生まれます。
国内環境における文書分類
韓国の金融と公共の受付経路には依然としてファクスが残っています。複数回再送された文書では異なる日付の表記形式が一行に重なって積み上がり、解像度が落ちて様式の表題の画がつぶれます。こうした条件でも種別を判定するには、表題の一箇所ではなく文書全体の手がかりを総合する必要があります。
文書形式も条件になります。韓国製ワープロ文書とスキャンPDF、画像ファイルが一つの業務の中に混在するため、形式ごとに異なる前処理が必要です。官公庁様式特有の多層の表構造と丸数字の項目番号も、種別判定の手がかりであり同時に妨害要素として働きます。
よくあるご質問
可能です。種別を判定する前に文書の境界を見つけてファイルを断片に分ける段階が先に動作します。この機能がなければ、後続の抽出が誤った項目表で進むことになります。
文書群によって異なります。金融文書46種を対象とした検証で97%水準が確認された事例があり、公共文書を対象とした検証では89.1%が確認されました。自社文書で測定した値を基準とするほうが正確です。
種別の定義を追加する方式で対応します。モデルのパラメータを再学習させる代わりに分類体系と項目スキーマを修正しバージョンとして残せば、運用負担が減ります。
可能です。ただしレイアウトがほぼ同じ様式の組で誤りが集中するため、様式の表題や文書番号のような決定的な手がかりを判定の根拠に含める設計が必要です。
未分類として分離され、担当者の検討対象になります。確信の低い案件を無理に分類しないことが全体の誤りを減らす方法です。
可能です。様式の表題一箇所に依存せず文書全体の手がかりを総合して判定するため、上部が損なわれた場合にも対応できます。