DEEP Agent
Features
Store
Glossary
Insights
Company
KO
데모체험
문의하기
GLOSSARY
OCRとParser、KIE、Agentからオンプレミス構築やRAG前処理まで一箇所に整理しました。
用語
36
カテゴリ
5
7
상세
AI WORKER
文書とデータを読み取って構造化し、判断まで行うことで人が担っていた業務を代行するAIです。質問に答えるAIとは異なり、結果を既存の業務システムに入力する地点まで責任を持ちます。
文書AI
文書を認識し理解するAI技術の範疇を指す表現です。文書を読む段階までを扱う概念であるため、読んだ後に業務を遂行する領域はAI Workerとして区別します。
INTELLIGENT DOCUMENT PROCESSING
文書の受付から認識、抽出、検証までを一つの流れにまとめて処理する知能型文書処理の体系です。個別機能を継ぎ足す方式ではなく業務プロセス単位で設計しなければ、実際の処理量は減りません。
ゼロタッチ
正常に処理できる案件はAIが自動で完了し、例外案件のみ人が確認する運用構造です。認識精度を上げることではなく人が手を触れる件数そのものを減らすことが目的で、3 Zero AI Worker戦略ではこれをZero Reviewと呼びます。
3 ZERO AI WORKER
繰り返しの学習、根拠のない判断、全件検収という三つの負担をそれぞれ取り除く方向で文書業務の自動化を設計する戦略です。Zero Training、Zero Hallucination、Zero Reviewを軸とし、成果は認識率ではなく人の介入なしに処理された比率で評価します。
DOCUMENT AUTOMATION
人が文書を開いて確認し、システムに転記していた作業をAIが代行することです。認識結果を画面に表示するところで止まると、自動化ではなく確認作業が一つ増えたに近い状態になります。
UNSTRUCTURED DATA
表の形に整理されておらず、そのままではシステムに投入できない文書や画像、ファクス、スキャンなどのデータです。企業が保有するデータの大半がここに含まれ、業務自動化はこのデータを読み取る地点から始まります。
6
電子文書管理システム
企業が文書の原本と処理履歴を保管し検索するシステムです。抽出されたデータがEDMSに格納されて初めて、以降のRPAや基幹システムへ業務がつながります。
人による検収介入
AIの処理結果のうち確信度が低いものだけを人が確認するよう設計する方式です。全件検収と無検収の間で運用リスクを管理する現実的な選択肢です。
ROBOTIC PROCESS AUTOMATION
定められた画面操作と入力手順をソフトウェアが反復実行する自動化ツールです。ルールが固定された区間に強いため、文書を判読する前段はAIが担い、以降の入力区間をRPAが担う組み合わせが一般的です。
無介入率
受け付けた案件のうち人の介入なしに最後まで処理された比率で、無介入率とも呼びます。認識精度よりもこの指標のほうが実際の人員削減効果を正確に示し、業務がシステム登録まで完了したかは業務完了率として別に見ます。
EXCEPTION HANDLING
定められた規則では判断できない案件を別の流れに分離する処理です。自動化の成否は正常案件の処理速度よりも、例外案件をどれだけ狭く定義したかで決まります。
FULL-TIME EQUIVALENT
同じ業務量を処理するのに必要な人員を常勤換算して比較する指標です。文書業務自動化の投資効果を説明する際に最も頻繁に求められる数値です。
10
エージェント
目標を受け取り必要なツールを自ら選んで使い、複数の段階を続けて進めるAIです。文書業務では抽出されたデータを根拠に条件を判断し、システムに登録する実行段階を担います。
文書構造化
文書の見出しや表、箇条書き、図といった構成要素と階層を分析し、機械が利用できるデータに変換する作業です。テキストだけを取り出すと構造が失われるため、その後の検索やRAGの品質はこの段階で決まります。
KEY INFORMATION EXTRACTION
文書から業務に必要な項目だけを選び、キーと値の組として抽出する技術です。OCRが何が書かれているかに答えるのに対し、KIEはその文字が業務上何であるかに答えます。
OPTICAL CHARACTER RECOGNITION
画像内の文字をテキストに変換する技術です。活字を読むことと実際の業務文書を読むことは別の問題であり、手書きや表、印影が一枚に混在した瞬間に難易度が変わります。
VISION LANGUAGE MODEL
画像とテキストを併せて理解し、文字だけでなく文書の配置と文脈まで解釈するモデルです。規則ベースのOCRが取りこぼしていた結合セルやチェックボックス、低画質のファクス文書で性能差が開きます。
AGENT WORKFLOW
文書分類から情報抽出、文書間検証、判断、担当者承認、システム実行までを一つの業務フローとしてつないだ自動化設計です。機能を個別に置くと区間ごとに人が橋渡し役になるため、一件が最後まで到達するかを基準に設計します。
CROSS VALIDATION
一つの業務案件を構成する複数の文書で同じ項目の値を突き合わせ、一致するかを判定する処理です。一枚あたりの認識精度がいくら高くても書類間で代表者名や口座番号が食い違えば業務は進まないため、審査の自動化はこの段階で完成します。
DOCUMENT CLASSIFICATION
受け付けたファイルがどの様式かを判別し、必要であれば文書単位に分割する処理です。複数の書類が一つのPDFに結合されて届く金融業務では、この段階が自動化全体のボトルネックになります。
LAYOUT ANALYSIS
ページ内で見出しや本文、表、ヘッダーといった領域を区分し、読む順序を決める処理です。多段組みや表の中の表のように人でも迷う構造で精度の差が現れます。
TABLE RECOGNITION
表の行と列、結合されたセルの構造をそのまま保ってデータに移す処理です。セルの値だけを読んで構造を失うと、項目と金額のつながりが切れて業務には使えません。
完全一致率
抽出した値が正解と一字まで同一である比率です。最も厳格な基準であるため、実際の運用目標は業務が許容する誤差を反映して別途定めます。
類似度ベース精度
空白や記号の違いを考慮して二つの文字列がどれだけ一致するかを測る指標です。人が読めば同じ値と判断される場合を反映するため、体感精度に近くなります。
表構造類似度
抽出した表が元の表の構造とどれだけ一致するかを測る指標です。テキスト精度が高くてもこの値が低ければ、表が中心の文書ではデータがずれます。
DE-IDENTIFICATION
文書から個人を特定できる項目を隠すか置き換える処理です。公共データを学習や検索の用途に移す際には事実上の前提条件になります。
FINE-TUNING
事前学習済みモデルを特定の文書群と業務ルールに合わせて追加学習させる過程です。様式が固定された企業文書では汎用モデルとの性能差が大きく開きます。
HALLUCINATION
モデルが根拠のない値をもっともらしく作り出す現象です。文書にない金額や日付が生成されればただちに業務事故になるため、値の根拠位置を併せて返し、確信の低い項目はそもそも生成しない設計が必要です。
BENCHMARK TEST
実際の業務文書で候補ソリューションの性能を同一条件で比較する検証です。公開ベンチマークの点数と自社文書での性能は異なるため、導入判断はこの結果で行います。
OCR API
文書画像を送ると認識結果が返る形で機能を連携するインターフェースです。初期検証には速い一方、保安要件のある組織は構築型の併用可否も併せて確認する必要があります。
VISION LANGUAGE MODEL OPERATIONS
一つの業務で検証したモデルとプロンプト、抽出スキーマ、品質基準を運用資産として蓄積し、バージョン管理と性能評価を経て運用に反映する体系です。様式が変わるたびにモデルを再学習させるのではなく抽出基準を変えて対応するため、様式改定の多い金融や公共の業務では導入後の維持コストをこの構造が左右します。
CHUNKING
長い文書を検索と生成に適した大きさに分割する作業です。段落や節の構造を無視して文字数だけで切ると、表や条項が途中で分断されます。
NETWORK SEPARATION
業務網とインターネット網を物理的または論理的に分離する韓国の保安規定です。外部API呼び出しが遮断されるため、導入可能なソリューションの範囲はこの地点で決まります。
ON-PREMISE
外部クラウドではなく顧客社内のサーバーにモデルとシステムを設置して運用する方式です。文書の原本を外部に出せない金融や公共の環境では選択肢ではなく要件になります。
RAG PREPROCESSING
検索拡張生成に用いる文書を構造と意味が保たれる形に整える事前作業です。回答品質が低い原因は、モデルよりもこの段階で文書が損なわれている場合が多くあります。
Start for free