非定型データとは何か:あるのに使えないデータの完全整理
非定型データとは、行と列に整理されておらずデータベースへそのまま格納できない文書や画像、スキャン、ファクスのように、人は読めてもシステムはすぐに扱えない状態のデータを指します。
データはあるのに使えない
データはあるのに使えません。
企業と機関が保有するデータの大半は非定型です。契約書と申請書、証憑書類、公文、手引き、議事録がファイルサーバーと文書管理システムに積み上がっています。量だけを見れば、どの組織もデータが不足してはいません。
問題はこのデータが照会されないという点にあります。どの契約書にどの条件が入っているかを確認するには、人がファイルを開いて読む必要があります。生成AIを導入しても事情は大きく変わりません。モデルへ渡せる形ではないためです。業務の自動化であれ検索であれ、出発点はこのデータを読み取る地点にあります。
非定型データの正確な定義:定型データと何が違うのか
定型データと非定型データ、三つの軸の違い
第一に、形が異なります。定型データは項目と値があらかじめ定められた構造の中に入っています。非定型データにはその構造がありません。同じ事業者登録番号でも、ある文書では表の中に、ある文書では文章の中に、ある文書では印影の横に書かれています。
第二に、扱う方法が異なります。定型データは照会すれば済みます。非定型データは読んで判別し構造を与える段階を経て初めて照会の対象になります。この段階が文書AIの領域です。
第三に、品質を測る方法が異なります。定型データは欠落と重複を見ます。非定型データは認識の精度と構造復元の精度を併せて見る必要があります。文字を正確に読んでも項目の対応が食い違えば使えないからです。
二つの種類は対立しません。非定型データを処理する目的は結局、定型データへ変えて既存システムへ入れることにあります。
実際の受付文書に現れる5つの要素
実際の受付文書に現れる5つの要素
第一に、形式がまちまちです。PDFと画像だけでなく、韓国製ワープロ文書やオフィス文書、表計算が一つの業務の中に混ざって届きます。
第二に、状態が揃っていません。ファクスで受け付けた低画質のスキャン、床に置いて撮影して皺と影の生じた画像、複数回再送されてヘッダーが重なって積み上がった文書が併存します。
第三に、妨害の要素が多くあります。印影が表を侵し、取り消し線が文字を横切り、透かしが重なります。人にとっては自然でも、機械にとっては誤読の原因になります。
第四に、様式が変わり続けます。同じ申請書でも支店と年度によって配置が変わり、官公庁の様式は定期的に改定されます。
第五に、一件が複数の文書で構成されます。業務一件に平均六種の書類が届き、書類の間の情報が合っているかを突き合わせて初めて処理が終わります。
非定型データの実際の扱い方
読み取りと構造化を分けて設計します
文字を読む作業と構造を与える作業を一つにまとめると、問題が生じたときに原因を絞れません。まずページから領域を判別して読む順序を定め、その後に各領域の内容を認識する順序が適切です。
こう分ければ改善の方向も明確になります。表がまるごと抜けていれば構造の判別の問題であり、表は取れているのに値が食い違うなら認識の問題です。
文書の一覧と受付経路を併せて整理します
導入を検討する際に必要なのは様式の一覧だけではありません。それぞれの様式がどの経路で届くかを併せて記録してください。ファクスで届く様式と営業店でスキャンされる様式は、同じ書類でも処理の難易度が異なります。
この整理があれば、どの文書群から自動化を始めるかの判断も容易になります。状態の良い経路から始めて範囲を広げる方式が現実的です。
国内環境における非定型データ
韓国の業務文書には固有の条件が重なります。韓国製ワープロ形式が広く用いられ、官公庁の様式には多層の表と丸数字の項目番号が入り、ファクスの受付が依然として残っています。
したがって検証の文書を構成する際には、きれいな標本ではなく実際の受付箱の文書をお使いください。公開された例示文書で測定した値と実際の文書で測定した値は異なる結果になります。
よくあるご質問
行と列に整理されていない文書や画像、ファクス、スキャンが含まれます。企業が保有するデータの大半がこの範疇です。
そのとおりです。読んで判別し構造を与えて初めて照会の対象になり、既存システムへ入れられます。
様式の一覧と併せて、受付の経路ごとの文書の状態を整理してください。損なわれた文書とファクスの受付分を含めて初めて実際の性能が現れます。
状態の良い経路から始めて範囲を広げる方式が現実的です。受付経路の整理があれば判断が容易になります。
認識の精度と構造復元の精度を併せて見てください。文字を正確に読んでも項目の対応が食い違えば使えません。