Fuzzy Similarityとは何か:体感に近い精度を測る指標の完全整理
Fuzzy Similarityとは、二つの文字列がどれだけ似ているかを比率として計算し、空白や記号のように人が大して気に留めない差を考慮した精度として示す指標です。
一文字の差が0点になる
一文字の差が0点になります。
文書AIの性能を完全一致の基準のみで測ると、実際の認識品質が歪む場合があります。長い住所で空白が一つ異なるか、商号の括弧の位置が異なれば、その項目はまるごと誤りになります。
人が見れば同じ値なのに点数は0です。こうした項目がいくつも積み重なれば、認識はうまくいっているのに性能の数値は低く出るという状況が生まれます。そうなると改善すべき場所がモデルなのか表記の正規化なのかを判断できなくなります。Fuzzy Similarityはこの区別を可能にする指標です。
Fuzzy Similarityの正確な定義:完全一致率と何が違うのか
完全一致率と類似度精度、三つの軸の違い
第一に、計算の方式が異なります。完全一致率は正しいか誤りかのみを見ます。類似度精度は二つの文字列の間の差を数えて比率へ換算するため、部分点が出ます。
第二に、反映するものが異なります。完全一致率は表記のわずかな差も誤りと見ます。類似度精度は人が同じ値と判断する場合を反映し、体感に近い数値を出します。
第三に、用いられる場面が異なります。完全一致率はシステムへ入力できるかを判断する際に用います。類似度精度は認識の品質そのものを比較したり、文書群の間の難易度を比較する際に用います。実際の検証では、活字と手書きのいずれも類似度基準で98%が確認された金融文書群があり、ある公共文書群ではテキスト類似度98.80%が測定されました。
二つの指標は置き換えの関係にはありません。類似度だけを見れば再入力の負担を見落とし、完全一致だけを見れば正規化で解決する問題を性能不足と誤解します。
解釈に入る4つの注意点
解釈に入る4つの注意点
第一に、計算の方式が製品ごとに異なる場合があります。文字の単位で数えるのか単語の単位で数えるのか、どの距離計算を用いるのかによって値が変わります。比較するには同じ方式で測定する必要があります。
第二に、長い文字列で値が高く出ます。住所のような長い項目は一、二文字が誤っていても類似度が高く保たれます。項目の長さごとに分けてご覧いただくほうが正確です。
第三に、業務への影響と直結しません。口座番号は一文字でも誤れば使えません。数字の項目には完全一致の基準を併せて適用してください。
第四に、改善の方向を教えてはくれません。類似度が低いという事実だけでは、認識の問題なのか文書の状態の問題なのか分かりません。低く出た項目を直接ご覧いただく必要があります。
Fuzzy Similarityの実際の活用方法
完全一致率と並べて置きます
二つの値を併せて見れば改善の方向が現れます。類似度は高いのに完全一致率が低ければ、表記の正規化で相当部分が解決します。いずれも低ければ認識の品質そのものを見る必要があります。
実際の検証資料をお求めになる際に二つの指標を併せてご依頼いただければ、製品の状態をはるかに正確に把握できます。
文書群の難易度を比較する際に用います
同じ製品で複数の文書群を測定すれば、どの文書群が難しいかが分かります。活字中心の文書群と手書きの多い文書群、ファクスの受付分が多い文書群で値が分かれます。
この比較は導入の範囲を定める際に役立ちます。類似度が明確に低く出る文書群があるなら、その文書群は後の段階へ回すか別の処理方式を検討する根拠になります。
国内環境におけるFuzzy Similarity
韓国の文書には表記の差が頻繁に生じる地点があります。商号の株式会社の表記、住所の道路名と地番の混在、銀行名の正式名称と略称が代表的です。
これらは人が読めば同じ値と判断する差であるため、類似度では高く出て完全一致では低く出ます。二つの値の差が大きい項目を集めて見れば、正規化の規則をどこに設けるべきかが見えてきます。
よくあるご質問
いずれも見るほうが適切です。二つの値の差が改善の方向を示します。
異なる場合があります。文字の単位か単語の単位か、どの距離計算を用いるかによって値が変わるため、比較には同じ方式での測定が必要です。
項目によって異なります。口座番号や事業者登録番号のような数字の項目には完全一致の基準を併せて適用してください。
一、二文字の差が全体の比率に与える影響が小さいためです。項目の長さごとに分けてご覧いただくほうが正確です。
低く出た項目を直接ご覧ください。指標だけでは認識の問題なのか文書の状態の問題なのか区別できません。