BMTとは何か:自社文書でソリューションを検証する方法の完全整理
BMT(Benchmark Test)とは、導入を検討する組織が自社の実際の業務文書とあらかじめ定めた評価基準を用いて、複数の候補ソリューションを同一条件で処理させ、性能を比較して導入の可否を判断する検証手続です。
BMTが必要な理由
公開された点数と自社文書での点数は異なります。
ソリューションの検討の場で最も頻繁にやり取りされる数値が精度です。ところが同じ製品がある文書では99%を出し、別の文書では80%台前半にとどまります。実際の検証事例を挙げると、申告様式の表構造の復元は99%以上と確認された一方、多層ヘッダーと結合が重なった行政文書では同じ項目が80%を下回りました。文書の分類も金融文書群で97%が出た事例と、公共文書群で89.1%が出た事例が併存します。
この差は製品の優劣ではなく文書の性格から生じます。したがって公開されたベンチマークの点数や提案書に記された精度だけで導入を決めると、運用に入ってから想定と異なる結果に直面します。BMTはこの危険を導入前に移しておく手続です。
BMTの正確な定義:PoCと何が違うのか
BMTとPoC、三つの軸の違い
第一に、対象が異なります。BMTは複数の候補製品を対象とします。同じ文書を同じ条件で処理させ、性能を並べて比較することが目的です。PoCは一つのソリューションを対象とし、実際の業務フローに組み込んだときに動作するかを確認します。
第二に、目標が異なります。BMTの目標は選択です。どの製品が自社の文書でより優れているかを判断します。PoCの目標は設計です。業務ルールと例外処理、システム連携をどのように構成するかを確定します。
第三に、成果指標が異なります。BMTは文書分類の精度、項目単位の完全一致率、表構造類似度のように製品間の比較が可能な指標を用います。PoCは一件あたりの処理時間、人が手を加えた比率、例外案件の比重のように運用の観点の指標を用います。実際の金融事例では、BMTの段階で完全一致の目標を90%に置いて文書分類と項目抽出の性能を測定し、その後の段階で運用基準を確定する順序で進められました。
二つの手続は置き換えの関係にはありません。BMTで候補を絞り、PoCで運用設計を確定する順序が一般的です。ただし文書群が単純で候補が一つに絞られている場合には、二つの手続をまとめて進めることもあります。
結果を信頼できるものにするBMTの6つの設計原則
実際の実施に入るBMTの6つの設計原則
第一に、評価文書を業務の分布に合わせて抽出することです。うまく出た文書だけを集めて評価すれば導入後に点数が下がり、難しい文書だけを集めれば製品間の差が現れません。実際の受付比率を反映して文書の種類と状態を混ぜて構成してください。ある金融事例では初期文書群46種を整理したうえで評価対象として50種を選定し、ある公共事例では文書8件から評価要素302個を抽出して測定しました。
第二に、正解データを先に作ることです。どの項目の正解が何であるかを人が確定しておかなければ点数を計算できません。この作業がBMTで最も時間のかかる部分であり、ここでいい加減に済ませると以降のすべての比較が揺らぎます。
第三に、指標をあらかじめ定義することです。精度という言葉は製品ごとに異なる計算を指します。完全一致で見るのか類似度を基準に見るのか、表は構造類似度で見るのか、分類はどの単位で数えるのかを文書で確定してから始めてください。
第四に、例外文書を必ず含めることです。印影が表を覆った文書、ファクスのヘッダーが何重にも積み上がった文書、値が空欄で判断を要する文書を入れて初めて製品間の差が現れます。正常な文書だけでは大半の製品が似た点数を出します。
第五に、条件を同一に揃えることです。同じファイル、同じ解像度、同じ項目定義で進めなければ比較が成立しません。一方にだけ抽出基準を細かく作り込めば、結果は製品の性能ではなく準備時間の差を示すことになります。
第六に、処理環境まで併せて確認することです。精度が同じでも社内設置が不可能であったり、必要な演算装置の規模が過大であれば導入できません。性能指標と配備要件を同じ表に置いて判断してください。
BMTの実際の進め方
文書の収集と項目定義を先に終えます
BMTの最初の成果物は評価結果ではなく、文書の一覧と項目定義書です。どの様式を何件入れるか、各様式からどの項目をどの形式で抽出するかを確定して初めて比較の基準が生まれます。
この段階で分類体系も併せて整理するとよいでしょう。ある金融事例では文書群を整理する過程で747個規模の分類コード体系を構築したうえで、抽出の検証へ進みました。分類が定義されていない状態で抽出の性能だけを測ると、実際の運用で生じるボトルネックを見落とすことになります。
測定と解釈を分けます
測定は機械的に行い、解釈は別に行います。点数が低く出た項目が製品の限界によるものか、正解データの定義が曖昧だったためか、原本の文書自体に根拠がなかったためかを区別する必要があります。
実際に、値が空欄のマスが該当なしなのか記入漏れなのかスキャンの欠損なのか、文書の中に判断する根拠がない場合があります。こうした項目を誤答として計算すると、製品の評価ではなく文書品質の評価になってしまいます。判断不能の項目は別に分類しておき、運用ルールで処理方針を定めるほうが適切です。
国内環境におけるBMT
韓国の金融と公共でBMTを実施する際に最初に直面するのは、文書をどこで処理するかという問題です。ネットワーク分離環境では評価用の文書を外部へ持ち出せないため、候補製品が社内に一時的に設置されて検証を進められるかをまず確認する必要があります。この条件を満たさない製品は性能とは無関係に評価そのものが不可能です。
文書形式の条件も併せて見ます。韓国製ワープロ文書と官公庁様式、ファクスの受付分が評価対象に含まれるかを確認してください。公開された例示文書で測定した値と自社の受付箱の文書で測定した値は異なる結果になります。BMTが存在する理由はまさにその差にあります。
よくあるご質問
参考にはなります。ただし公開評価データと自社文書は構成が異なるため、順位がそのまま再現されるわけではありません。導入の判断は自社文書で測定した結果で行ってください。
文書群の多様性によって異なります。様式50種の規模で進めた金融事例があり、文書8件から評価要素302個を抽出して進めた公共事例があります。件数よりも実際の受付分布を反映しているかが重要です。
必要です。正解が確定していなければ点数を計算できず、製品間の比較も成立しません。BMTで最も手間のかかる作業ですが省略できません。
業務によって異なります。値をシステムに入力する業務であれば項目単位の完全一致率を、表が本文である文書であれば表構造類似度を、受付の自動化であれば文書分類の精度を優先指標としてください。
可能です。候補製品を社内に一時的に設置して進める方式であれば、文書を外部へ持ち出さずに検証できます。
多くの場合その間にもう一段階あります。業務ルールと例外処理、システム連携を確定する検証の段階を経てから運用へ移行する流れが一般的です。