国内大手金融会社の導入事例、AI OCRの性能評価
AI OCRを検討する際、まず目にするのはたいてい精度です。ところが実際の導入段階では、一つの数字だけで判断しにくい場合が多いのです。
あわせて読みたい記事:金融AI OCRの導入事例と効果
実務では、文書を読むだけで作業が終わるわけではないからです。どのような文書かを区別し、必要な値を見つけ、複数の文書に書かれた内容が合っているかも改めて確認しなければなりません。ですから金融のように文書の種類が多く検討基準が厳しい環境では、単なる認識率よりも文書分類と項目抽出が、実際の運用文書でどれほど安定して動くかを、より重視することになります。
本記事では、国内大手金融会社の実文書の検収結果をもとに、VLM(Vision-Language Model、視覚言語モデル)を導入したAI OCRの性能評価を、どのような基準で見るべきかを整理します。
OCRの性能評価は、なぜ数字だけでは足りないのか
文書AIを検討する際、まず精度が何パーセントかを尋ねることが多いものです。もちろん重要な基準です。しかし実際の業務では、それだけでは足りません。
AI OCRがうまく動くかを見るには、テキストを読む性能だけでなく、文書を業務にそのまま使える形へ整理してくれるか、言い換えれば文書自動化に実際に活用できるかまで、あわせて見る必要があります。
1. なぜOCRの検収が必要だったのか
事例の顧客企業は、繰り返し受け付けられる金融文書を、より速く安定して処理できる方法を検討していました。問題は、文書が常に同じ形で入ってくるとは限らない点でした。印刷体の文書もあれば手書き入力を含む文書もあり、受付後は単なるテキスト確認よりも文書の種類の識別と重要情報の整理のほうが重要な場合が多かったのです。
今回の検収も、こうした背景で行われました。重要だったのは認識率の数字一つではなく、実文書を基準に、文書分類とKey-Value抽出の結果をどこまで信頼できるかを確認することでした。
2. VLM OCR:少数のサンプルではなく、実際の運用文書の範囲での評価
今回の評価は、一部の例示文書を対象にしたテストではなく、実際の運用に入ってくる文書の範囲を基準に行われました。
検収に用いた文書は全149種で、ビジネス基準では400件の文書でKey-Value抽出の結果を確認しました。似た文書どうしをまとめて見ると約180件ほどに減りますが、実務では同じ系列の文書の中でも、様式の違い、記入方式の違い、配置の違いが絶えず生じます。
この数字が重要な理由は明確です。従来の一般的なAI OCRは、決められた様式(座標)を外れると認識率が急激に落ち、149種の文書を一つひとつ学習させなければならないという限界がありました。
しかし、今回の評価に導入したソリューションはVLM(視覚言語モデル)ベースでした。VLMは人のように、文書の全体的な文脈と視覚的な構造を同時に理解します。おかげで、一つ二つの定型様式でだけよく読めるのを超えて、事前の座標マッピングなしでも、現場で繰り返し入ってくる文書の多様さの中で安定して結果を出せました。
今回の評価は、大きく二つの項目で行われました。
文書分類文書がどの種類かを区別する段階です。この段階が揺らぐと、後の抽出結果もともに揺らぎかねません。
Key-Value抽出文書の中から必要な値を取り出す段階です。氏名、金額、識別情報、申請情報のように、実際の業務処理に必要な項目を正確に整理できるかを見る基準です。
そしてKey-Value抽出は、さらに二つの領域に分けて評価しました。
印刷体
手書き
実際の文書業務では、この違いが大きいのです。印刷体は比較的規則的ですが、手書きは作成者ごとに文字や位置が異なるため、運用の難易度をより明確に映し出すからです。
4. 評価の方式と結果はどうだったか
評価の方式は、収集したサンプルをもとに正解を手作業で作成したうえで、OCRの結果値と照合し、音節の一致数を数える方式で行われました。
結果は次のとおりです。
文書分類
基準:95パーセント以上
結果:97パーセント
判定:Pass
Key-Value抽出 - 印刷体
基準:95パーセント以上
結果:98パーセント
判定:Pass
Key-Value抽出 - 手書き
基準:92パーセント以上
結果:98パーセント
判定:Pass
結果だけを見れば、単に基準を超えたと捉えられます。しかし実務的には、それ以上に重要な意味があります。
文書の種類が多い環境で文書分類が97パーセントの水準で維持され、項目抽出も印刷体と手書きのいずれも98パーセントで基準を超えたことは、実際の運用段階でも文書を構造的に扱える可能性を示す結果だからです。
5. この結果が、実際の業務で意味すること
今回の評価は、文書149種、ビジネス基準で400件の文書、そして類似文書をまとめても約180件の水準の文書群を前提に行われました。
これはつまり、特定の様式を一つ二つだけよく読んだ結果ではなく、実際の業務文書群で文書分類とKey-Value抽出がどれほど安定して動くかを見た結果だということです。
金融分野でAI OCRやOCRソリューションを検討する際は、たいてい次のような問いが伴います。
文書の種類が多くても安定して処理できるか
似た様式が混ざっていても区別できるか
必要な値が、業務にそのまま使える形へ整理されるか
人が改めて見なければならない範囲を減らせるか
ですからAI OCRの性能評価は、単に認識率が高いかを見る段階を超えて、実際の運用で検討の負担をどれだけ減らせるかを判断する基準として見るほうが、より現実的です。
6. 韓国ディープラーニングは、文書を文書AIの観点から捉えます
韓国ディープラーニングは、OCRを単なるテキスト認識機能とだけは捉えません。文書を分類し、構造を理解し、必要な値を抽出し、異なる文書間の内容を比較・検証したうえで、人が改めて見るべき部分だけを残す流れを重視します。
この過程でDEEP OCRが文書を読み、DEEP Parserが文書構造を解釈し、DEEP Agentが分類・抽出・検証・検収・連携までつながる文書処理全体の流れをつなぎます。
文書が多く、様式が異なり、検討基準が頻繁に変わる環境ほど、単なるOCRよりも、こうした文書AIの方式が実際の運用により近いアプローチになります。
おわりに
AI OCRの性能評価は、単に精度の数字を見る段階で終わりません。どのような文書群を対象に評価したのか、テンプレートの制約なしに文書分類とKey-Value抽出が実際の運用文書で安定して出るのか、そしてその結果が人の検討負担をどれだけ減らすのかまで、あわせて見る必要があります。
今回の国内大手金融会社の事例も、同じ点を示しています。実際の受付文書を基準に、文書分類とKey-Value抽出を分けて検収し、印刷体と手書きを区別して確認しました。そしてその結果は、全項目で基準の充足につながりました。
結局のところ重要なのは、OCRが文字を読むかどうかだけでなく、実際の文書環境の中で、どこまで安定して活用できるかです。
文書自動化を検討しているなら、機能紹介だけを見るよりも、実文書を基準とした検収の方式と評価項目を先に確認するのがよいでしょう。
*参考資料
1. KIEval: Evaluation Metric for Document Key Information Extraction
2. Beyond Document Page Classification: Design, Datasets, and Challenges
3. Intelligent document processing with AWS AI services: Part 1
💡自社の文書を基準に、どのような評価方式が適切かを確かめたいなら、韓国ディープラーニングにお問い合わせください。