Exact Matchとは何か:文書AIの精度を正直に測る基準の完全整理

Exact Match(完全一致率)とは、抽出した値が人の定めた正解と一字一符号まで同じ場合のみ正解として数えて算出する指標であり、文書AIの性能を最も厳格に判定する基準です。

精度という言葉が通じない理由

同じ製品が二桁の差で報告されます。

ソリューションの検討の場で、精度98%という数値と90%という数値が併せて出てくる場合があります。いずれも虚偽ではありません。前者は空白や記号の差を考慮した類似度基準であり、後者は一字まで問う完全一致の基準であるためです。

計算の単位も異なります。文字一つを単位として数えれば、長い住所で一字だけ誤っても大半が正解として計算されますが、項目一つを単位として数えればその住所はまるごと誤りになります。業務の観点では後者の計算が適切です。住所の一字が誤った値はシステムに入れられないからです。

したがって導入検討で確認すべきは何パーセントかではなく、何をどのように数えたかです。

Exact Matchの正確な定義:類似度ベースの精度と何が違うのか

Exact MatchとFuzzy Similarity、三つの軸の違い

第一に、判定の方法が異なります。Exact Matchは正しいか誤りかの二択で判定します。Fuzzy Similarityは二つの文字列がどれだけ似ているかを比率として計算し、部分点を与えます。

第二に、反映するものが異なります。Exact Matchは表記のわずかな差も誤りとして処理します。ハイフンの抜けた事業者登録番号や空白の異なる商号がここで引っかかります。Fuzzy Similarityは人が読めば同じ値と判断される場合を反映するため、体感精度に近くなります。

第三に、用いられる場面が異なります。Exact Matchは抽出した値をそのままシステムへ入力する業務で基準になります。値が少しでも異なれば登録が失敗するか、誤ったデータが蓄積されるためです。Fuzzy Similarityは認識品質そのものを比較したり検収の負担を見積もる際に有用です。実際の検証で活字と手書きの類似度基準の精度が98%と確認された金融文書群の場合、同じ文書群の完全一致の目標は90%に置かれました。

二つの指標は置き換えの関係にはありません。類似度だけを見れば実際の業務で発生する再入力の負担を見落とし、完全一致だけを見れば表記の正規化で解決する問題まで性能不足と誤解します。二つの値を併せて見るほうが正確です。

完全一致率を正しく用いる5つの基準

測定に入る完全一致率の5つの基準

第一に、計算の単位を項目として捉えます。文字単位で計算すると実際の業務への影響とかけ離れた数値が出ます。担当者がシステムへ入力する項目一つを単位として数えるほうが適切です。

第二に、正規化の規則をあらかじめ定めます。ハイフンや空白、括弧、単位の表記をどう処理するかを定めておかなければ、同じ結果が測定のたびに異なる点数として出ます。業務で許容される表記の差は正解の判定前に正規化しておくほうが実用的です。

第三に、項目別に分けて見ます。全体の平均一つだけを見てもどの項目が問題か分かりません。金額と日付、氏名、口座番号は誤りの性格と業務への影響がそれぞれ異なります。

第四に、目標値を業務基準で定めます。100%を求めるのは現実的でなく、といって任意に定めることもできません。誤り一件がどのような結果を生むか、その後ろに検証ルールと人の検収があるかを併せて計算して定めます。

第五に、判断不能の項目を別に数えます。原本に値がないかスキャンが欠損して人でも判定できない項目があります。こうした項目を誤答として計算すると、製品の評価ではなく文書品質の評価になってしまいます。

完全一致率の実際の適用方法

正解データと正規化の規則を併せて作ります

測定の最初の成果物は正解データです。文書ごとに各項目の正解を人が確定して記録する作業ですが、ここに正規化の規則を併せて記しておくほうが適切です。

たとえば事業者登録番号はハイフンを除いた十桁で比較し、金額はカンマと通貨記号を除いた数字で比較し、日付は定められた形式へ変換して比較する、といった具合です。この規則が文書として残っていれば、後で再び測定するときにも同じ基準が適用されます。

運用指標と分けて管理します

完全一致率は導入の判断と性能の比較のための指標です。運用に入ると別の指標が必要になります。人の介入なしに最後まで処理された比率、検収者が実際に修正した項目の比率、例外へ回った案件の比重といった値です。

二種類を分けて管理すれば、それぞれの用途が明確になります。完全一致率が下がったならモデルか様式の問題であり、完全一致率はそのままなのに修正の比率が上がったなら検収の基準か業務ルールの側を見る必要があります。

国内環境における完全一致率

韓国の文書には表記の差が頻繁に生じる地点があります。商号に含まれる株式会社の表記が前に付くこともあれば後ろに付くこともあり、括弧で括られることもあります。住所は道路名と地番が混在し、階と号室の表記がまちまちです。銀行名は正式名称と略称が併用され、一つの文書では正式名称で別の文書では略称として現れます。

こうした差をすべて誤りとして計算すれば、完全一致率が実際より低く出ます。逆にすべて許容すれば、業務で問題となる差まで通してしまいます。どの表記の差が業務で同じ値として扱われるかを業務担当者と併せて整理しておく作業が必要です。

よくあるご質問

いずれも見るほうが適切です。値をそのままシステムへ入力する業務であれば完全一致率を優先の基準とし、認識品質の比較には類似度精度を併せてご参照ください。

業務によって異なります。ある金融文書の検証では完全一致の目標を90%に置きました。誤り一件の影響と後ろにある検証ルールを併せて計算してお定めください。

正規化の規則によって変わります。業務で同じ値として扱われる表記の差は比較の前に正規化しておくほうが実用的です。

判断不能として別に分類してください。人でも判定できない項目を誤答として計算すると、製品の性能ではなく文書の品質を測ることになります。

必ずしもそうではありません。人の介入なしに最後まで処理された比率を併せてご覧いただいて初めて、実際の削減効果が現れます。

関連用語