Human-in-the-Loopとは何か:検収を設計として扱う方法の完全整理
Human-in-the-Loopとは、AIの処理結果のうち確信の低いものだけを人が確認するよう設計し、確認された内容を再び流れへ戻して業務を続けられるようにする運用方式です。
検収を後から決めてはいけない理由
全部見るか、まったく見ないかのどちらかでした。
文書の自動化を導入する際、検収をどうするかは後で決める場合が多くあります。その結果、二つの状態のいずれかに固まります。不安なので全部を確認するか、信頼して何も確認しないかです。
前者は自動化の効果を消します。後者は誤りが業務事故につながるまで表面化しません。実際に必要なのはその間です。どの案件が安全でどの案件が危ういかを区別し、危ういものだけを人へ送る設計です。検収を後から付ける機能ではなく、最初から設計する構造として扱うべき理由がここにあります。
Human-in-the-Loopの正確な定義:全件検収と何が違うのか
全件検収と選別検収、三つの軸の違い
第一に、対象が異なります。全件検収はすべての案件を見ます。選別検収は基準線を下回る項目を含む案件のみを見ます。案件ではなく項目の単位で選り分けることが要点です。
第二に、目標が異なります。全件検収の目標は誤りを見逃さないことです。選別検収の目標は誤りを見逃さずに確認の対象を狭めることです。二つ目の条件が付いた瞬間に設計が必要になります。
第三に、成果指標が異なります。全件検収は発見した誤りの件数を見ます。選別検収は検収へ回った比率と、そのうち実際に修正された比率を併せて見ます。回した案件の大半が修正なしに通過するなら、基準線が高すぎるという意味です。
二つの方式は置き換えの関係にはありません。導入の初期は全件検収から始めてデータを集め、そのデータを根拠に選別検収へ移る経路が安全です。
Human-in-the-Loopを支える5つの要素
実運用に入る5つの要素
第一に、項目単位の信頼度です。文書全体に一つの点数しかなければ、どの値を見るべきか分かりません。
第二に、原文位置の表示です。値を選ぶと原本の該当部分が見えて初めて、検収者が文書を最初から読まずに済みます。
第三に、検証ルールの結果です。なぜこの案件が検収へ回ってきたのかが画面に表示される必要があります。信頼度が低いためか、合計が合わないためかによって確認すべき場所が異なります。
第四に、修正の履歴です。誰が何をどう直したかが残って初めて、監査に対応でき基準線の調整の根拠としても使えます。
第五に、戻る経路です。修正された値が再び流れに乗ってシステムへ登録される必要があります。この経路がなければ、検収者が結果を別に入力することになります。
Human-in-the-Loopの実際の適用方法
基準線をデータで定めます
基準線を最初から正確に置く方法はありません。初期は保守的に設定し、実際の検収の結果を集めて調整します。
修正がほとんど発生しない項目は基準線を下げて自動処理へ回し、修正の多い項目は基準線を上げるか検証ルールを追加します。この調整を繰り返せば検収の対象が次第に狭まります。
検収者の動線を短くします
検収画面の設計が実際の処理時間を大きく左右します。問題となった項目のみを強調し、原本の該当位置を併せて示せば、一件あたりの確認時間が短くなります。
文書種別ごとの抽出項目とスキーマを管理する画面を併せて置けば、繰り返し修正される項目を見つけたときに検収者が自ら基準を手直しすることもできます。
国内環境におけるHuman-in-the-Loop
韓国の金融と公共では、内部規定により人の確認が必要な区間が品質上の検収とは別に存在します。技術的に自動処理が可能でも規定上の承認が必要な案件は、検収の統計から分けて記録するほうが適切です。
監査の要件も併せて関わります。誰がいつ何を修正したかの履歴が保管される必要があり、運用環境と検収環境を分けて変更の手続を統制できる構成が求められます。
よくあるご質問
値の信頼度が基準を下回る項目を含む案件と、文書間の突き合わせで食い違った案件、そして業務ルール上の判断が必要な案件に分けて定めます。
お勧めしません。初期は全件検収でデータを集め、その履歴を根拠に基準線を定めて選別検収へ移る順序が安全です。
基準線の調整と抽出基準の見直しの根拠として使います。同じ項目で修正が繰り返されるなら、その項目の設定を手直しする時期と見ます。
基準線が高すぎるという意味です。修正の発生しない項目から基準線を下げ、自動処理の範囲を広げてください。
そのように設計する必要があります。戻る経路がなければ、検収者が修正した結果を別途システムへ入力することになります。