契約書のデータ抽出とは、契約書に含まれる金額、契約期間、更新日、特約条項、契約の相手方といった重要項目を、人が書き写すことなく自動で取り出し、構造化されたデータにする作業です。これは、契約が有利か不利かを法的に判断する契約書審査とは異なります。法務チームが審査を始める前に、そして購買・財務チームが契約を管理するために、まず数多くの契約書から正確なデータを取り出しておく段階です。
💡 重要ポイントのまとめ
契約書のデータ抽出は、法律的な審査ではなく、審査と管理のための事前整理の段階です。契約書は様式がばらばらで、表や特約、条項の関係が絡み合っているため、単なるテキスト抽出では項目がずれやすいのです。そのため、構造を保存した抽出と、根拠の検証がともに必要です。
契約書のデータ抽出とは、契約書審査と何が違うのか
この二つは、目的と担い手が異なります。契約書審査は、条項が自社に不利ではないか、法的なリスクはないかを判断する仕事で、主に法務チームや弁護士が担います。一方、契約書のデータ抽出は、契約書から金額、期間、更新日、特約といった事実情報を取り出し、表やデータベースへ整理する仕事です。
順序で見れば、抽出が先です。数百件の契約書が積み上がっているとき、人が一つひとつ開いて重要項目をExcelへ書き写す代わりに、この段階を自動化すれば、法務チームは審査に集中でき、購買・財務チームは更新日と金額を見逃さずに管理できます。本記事では、この抽出の段階を自動化する際に何を確認すべきかを扱います。
契約書が自動抽出で特に難しい理由
契約書は、他の文書よりも自動抽出が厄介です。第一に、様式が相手方ごとに異なります。標準的な書式がなく、同じ項目が文書ごとに異なる位置と表現で登場します。第二に、重要情報が表や別紙に散らばっています。代金の支払条件や物品明細が、結合された表の中に入る場合が多くあります。第三に、特約とただし書き条項が本文と絡み合っています。更新条件や例外事項が複数の条項にまたがって参照されるため、条項間の関係を見落とすと意味が変わります。第四に、スキャン版や手書きの署名、印鑑が混ざっています。
このため、単に文字を読むだけの方式では足りません。文字を正確に読み取っても、表の行と列がずれたり、特約が見当違いの条項に付いたりすると、金額と項目が誤って結びついたデータが、そのまま契約管理システムへ渡ってしまいます。こうした誤りは、人に再び全数確認をさせ、自動化の利点を失わせます。契約書では、文字を読むことと同じくらい、文書の構造と条項の関係を保存することが重要です。
自社でも確認が必要なケース
契約書の重要項目を、人がExcelへ書き写している |
契約の更新日や満了日を見逃したことがある |
契約書の様式が相手方ごとに異なる |
スキャン版、画像、手書きの契約書が混ざっている |
抽出結果を、契約管理やERPシステムへ入力し直している |
二つ以上当てはまるなら、契約書のデータ抽出の自動化を検討する時期です。
契約書のデータ抽出、導入前に確認する5つのこと
手法や精度の数値だけを比較する前に、実際の導入を決める際は、次の五つをあわせて見なければなりません。
第一に、項目の精度です。
全体の文字精度ではなく、金額や更新日のように、業務に不可欠な重要フィールドが正確に取り出されるかを見なければなりません。
第二に、文書構造の保存です。
表の行と列、項目と値のつながり、条項間の参照関係が、データへ変換されたあとも維持されるかを確認しなければなりません。
第三に、根拠の追跡可能性です。
抽出された値が、契約書のどの条項、どの位置から出たのかをたどれてこそ、担当者が素早く検証できます。
第四に、低信頼結果の例外分離です。
かすれたスキャン版や見慣れない様式のように、信頼度の低い案件を選んで人へ渡し、残りの正常な案件は自動で処理できなければなりません。
第五に、システム連携です。
抽出したデータが、契約管理システムやERPへ自動で渡されてこそ、再入力がなくなります。
PoCで確認する指標
公開ベンチマークや認識率だけでは、実際の業務への適用可能性を判断しにくいものです。実際に自社の契約書で試す際は、次をあわせて測定することをおすすめします。重要フィールドが正解と一致するフィールド精度、表や条項の構造が維持される構造保存率、人の介入なしに処理された自動処理率、追加確認が必要だった例外検収率、そして誤った結果を正常として誤って通してしまった誤正常処理率です。自動処理率が高くても、誤正常処理率があわせて管理されなければ、安全な自動化とは言いにくいのです。
契約書のパース結果を見る実際の契約書で、項目がどのように抽出され構造化されるかを確認してみてください。
韓国ディープラーニングは契約書をどう処理するのか
韓国ディープラーニングは、契約書を三つの段階に分けて処理します。DEEP OCRが、相手方ごとに異なる様式、スキャン版、手書き、多言語が混ざった契約書を、テンプレート登録なしに読み取ります。DEEP Parserが、表や別紙、特約、条項間の関係を構造として保存してデータへ変換し、契約管理システムやERPと連携します。DEEP Agentが、抽出と分類、検証を自動で行い、信頼度の低い案件だけを例外として人へ渡します。
韓国ディープラーニングのVLM OCRは、定型の様式がない非定型文書をテンプレートなしに処理し、グローバルなマルチモーダルOCRベンチマークであるOCRBench v2の英語部門で1位を記録しました。契約書のような機微な文書は、外部ネットワークへ送らず、オンプレミスの内部ネットワークで処理できます。
韓国ディープラーニングが目指す3 Zero AI Workerのうち、契約書のデータ抽出に接するのは、Zero HallucinationとZero Reviewです。Zero Hallucinationは、抽出された値を契約書の原文と照らして検証する方向で、根拠のない値がそのまま渡らないようにします。Zero Reviewは、正常な案件は自動で処理し、信頼度の低い案件や危険な案件だけを人が確認するようにして、すべての結果を人が再び検収する負担を大きく減らすことを目指します。
契約書を数百件、人が整理しているなら、抽出から自動化できます。認識精度だけでなく、自社の契約書で自動処理率と例外検収率がどれだけ出るかで判断してください。
契約書自動化の導入相談が必要ですか?自社の契約書の様式とセキュリティ環境に合う適用範囲をご相談ください。
よくある質問
Q1. 契約書のデータ抽出と契約書審査は、どう違うのですか?
抽出は、契約書から金額や期間といったデータを取り出す仕事で、審査は、条項が法的に有利か不利かを判断する仕事です。抽出は、審査と管理のための事前の段階です。
Q2. 様式がばらばらの契約書も抽出できますか?
テンプレートをあらかじめ登録しなくても、文書の構造を把握して処理します。相手方ごとに書式の異なる契約書にも適用できます。
Q3. スキャン版や手書きが混ざった契約書も可能ですか?
非定型文書、手書き、多言語が混ざった文書をあわせて処理します。
Q4. 抽出結果が誤っていないか、どう確認しますか?
抽出された値が契約書のどの条項から出たのか、根拠を追跡でき、信頼度の低い案件は例外として分離し、人が確認します。
Q5. 契約書を外部へ送らずに処理できますか?
オンプレミスの内部ネットワークで処理でき、機微な契約情報が外部へ送信されません。