企業環境で一日に数千件ずつ処理される文書は、単なる「読みやすくスキャンされたテキストの集まり」ではありません。
それぞれの文書には氏名、住所、金額、日付、単価、数量のように、ビジネスプロセスの核心的な値が入っており、これらの値が間違いなくOCRされるかは、業務自動化の最初の段階であり、最も重要な基盤になります。
そのため、OCRが揺らげば、その上で回るParser、KIE(Key-Value Extraction)、DBマッピング、承認手続きなど、全過程が一緒に揺らいでしまいます。
今回の実験は、こうした前提のもとで、同一の申告書のスキャンをChatGPTとDEEP Agent Labに入力し、二つのモデルが「文字をどれほど正確に読むか」だけを評価する実験です。すなわち、構造の復元やエンティティの分離のような高度な機能は除き、徹底してOCRのレベル(文字単位の認識精度)だけに焦点を合わせました。
同じ文書でも、二つのモデルの結果は完全に異なった
以下の画像は、同一の申告書をOCRしたときの実際の比較です。
実験は単純です。同じ文書を入れたのに、結果は明確に異なります。
ChatGPTは文章単位で書き直す傾向があり
一部の文字を誤って読んだり、原文と異なる順序で再構成されたりもします。
一方、DEEP Agent Labは原文の文字単位を最大限そのまま保存し
数字・住所・固有名詞などの重要なフィールドで、誤差がほとんどありません。
目で見るだけでも「ああ、この結果はシステムにそのまま入れてよさそうだ/だめそうだ」がすぐに判断できるほどの違いが生じます。
性能指標で見ると、違いはさらに鮮明になる
OCRの性能は、感覚や印象では判断できません。正確な数値が必要です。そこで、社内テストセット200枚を基準に、以下の8つの指標を比較しました。
最も重要ないくつかの数値を要約すると、次のとおりです。
● OCR Text Accuracy
ChatGPT: 82.4%
DEEP Agent Lab: 98.7%
テキスト精度における15%の差は、実務では「使用可能」と「使用不可」の差です。
● Numeric Field Accuracy (金額 / 単価 / 数量 など)
ChatGPT: 83.1%
DEEP Agent Lab: 99.1%
数字を一つ誤ると、決済エラー、精算エラー、審査エラーが起きます。この領域で、DEEP Agent Labは特に強さを見せました。
● OCR Failure Rate
ChatGPT: 14〜17%
DEEP Agent Lab: 0.9%
文字認識の失敗とは、まるごと欠落したり空白が生じたりする場合を意味します。実務では事実上、許容されにくいものです。
● Speed(sec/page)
ChatGPT: 3.4秒
DEEP Agent Lab: 0.6秒
速度まで考慮すると、全体の処理量で5倍以上の差が出ます。
なぜこのような違いが出るのか? — モデルの哲学そのものが異なるからだ
以下は、ChatGPTとDEEP Agent LabがOCRを処理する方式が根本的に異なることを示すモデル比較です。
📌 画像:モデル比較表を挿入
🔴 誤答 🟢 正答
● ChatGPT
ChatGPTは基本的に自然言語処理(NLP)に最適化されたモデルです。画像を分析して文字を読むというより、画像の中のテキストをもとに「人が読みそうな文章」をつくります。
そのため、次のような特徴が表れます:
文章の流れに合わせて内容を並べ替える
数字や名前で「補正」が発生する
自然言語の文章で説明するように出力する
これはGPTの強みであると同時に、文字をそのまま読まなければならないOCR作業では短所になります。
● DEEP Agent Lab
一方、DEEP Agent Labは最初から文字認識の精度に焦点を合わせたVLMベースのOCRエンジンです。
スキャン品質(ブレ・ノイズ・低解像度)に強い
数字・住所・コード値のような機微な領域で高い精度
原文を修正せず「あるがまま」に抽出
自動化システムがそのまま使える形で出力
すなわち、ChatGPTが「説明文」でテキストを再構成するアプローチだとすれば、DEEP Agent Labは「原文保存」を最優先とします。
ベンチマークのグラフ — 数値が視覚的に伝えるメッセージ
以下のグラフは、四つの核心的なOCR指標を視覚化したものです。
OCR Text Accuracyから速度まで、DEEP Agent Labがすべての指標で安定した優位を見せます。直観的に理解しやすいグラフのため、最も多く共有されたセクションでもあります。
OCRは文書AIの始まりであり、品質を決める最初のボタンだ
「同じ文書を入れても、二つのモデルの設計目的によって、OCRの結果は完全に異なって出てきます。」
ChatGPTは自然言語の推論に優れていますが、一文字単位の正確性が重要なOCR環境では、原文の損失、数字の誤り、並べ替え現象が発生します。
一方、DEEP Agent Labは一文字も間違えない正確性、実務環境を考慮した安定性をもとに、企業の文書自動化に最適化された成果物を提供します。文書ベースの自動化の最初の段階は、いつも同じです。「文字をどれほど正確に読んだか。」この実験は、その違いを最も単純で、最も明確な方法で示しています。