ファインチューニングとは何か:いつ追加学習が必要かの完全整理

ファインチューニングとは、すでに大規模なデータで学習されたモデルへ、特定の文書群と業務ルールに合ったデータを追加で学習させ、その領域での性能を引き上げる過程です。

問題は平均ではなく例外で生じる

問題は平均ではなく例外で生じます。

汎用モデルは一般的な文書で良い性能を出します。ところが実際の業務の現場で事故が起きる地点は、平均的な文書ではなく例外的な文書です。印影が表を侵し、取り消し線が行を横切り、ファクスのヘッダーが四重に積み上がった文書がそうです。

実測を見ればこの差がはっきり現れます。公共行政文書90万枚から1千枚を無作為に抽出して測定した結果、項目の名前を見つける精度は97.3%と80.4%に分かれ、その名前に付いた値を取ってくる精度は96.0%と48.7%へと二倍近く開きました。特定の文書群で学習したモデルとそうでないモデルの格差です。

ファインチューニングの正確な定義:基準の調整と何が違うのか

基準の調整とファインチューニング、三つの軸の違い

第一に、変える対象が異なります。抽出基準の調整は、モデルへ何を探せと指示する文章を変えます。ファインチューニングはモデルの内部の値を変えます。

第二に、必要なものが異なります。基準の調整には業務の知識と事例が数件あれば足ります。ファインチューニングには正解の付いた学習データが相当量必要であり、演算の資源と時間がかかります。

第三に、戻し方が異なります。基準の調整は文章を戻せば終わります。ファインチューニングは以前のモデルのバージョンを保管しておいて初めて戻せます。

二つの方法は置き換えの関係にはありません。順序を定めるなら、基準の調整でまず解決を試み、それで届かない領域にファインチューニングを用いるほうが費用対効果が良くなります。

判断に入る4つの基準

判断に入る4つの基準

第一に、基準の調整で解決するかをまず確認します。項目の定義を整え抽出のヒントを変えるだけで相当数の問題が解けます。この段階を飛ばせば不要な学習の費用が生じます。

第二に、学習データを作れるかを確認します。正解の付いた文書が十分にある必要があり、その正解を作る作業には相当な時間がかかります。

第三に、文書群が安定しているかを確認します。様式が毎月変わる領域であれば、学習が終わる頃には対象が変わっています。

第四に、個人情報の処理方針を確認します。実際の業務文書を学習に用いるには非識別化が先行する必要があり、学習の環境も統制された場所である必要があります。

ファインチューニングの実際の進め方

難しい事例を中心にデータを集めます

うまく処理される文書を多く入れても性能は上がりません。失敗した事例と例外へ回った案件を集めるほうがはるかに効果的です。

検収の履歴がここで役立ちます。担当者が繰り返し修正した項目、確信が低く例外へ分離された案件を集めれば、それがそのまま学習データの候補になります。よく処理される文書を追加しても、モデルはすでに知っていることを繰り返し学ぶだけです。

評価のセットを先に分離します

学習データと評価データを混ぜてはいけません。学習に用いた文書で性能を測れば、実際より高い値が出ます。

学習を始める前に評価用の文書を分離し、その文書は学習に一切使わないでください。この分離がなければ、性能が上がったのか記憶しただけなのかを区別できません。

国内環境におけるファインチューニング

韓国の金融と公共では実際の業務文書に個人情報が含まれるため、学習に用いる前に非識別化が必要です。加えてネットワーク分離環境では、学習の過程も社内網の中で行われる必要があります。

したがってファインチューニングを検討する際には、モデルの性能だけでなく学習の環境を社内に構築できるかを併せてご確認ください。外部へ文書を送って学習する構成は、この地点で検討の対象から外れます。

よくあるご質問

文書群の性格そのものが変わる場合です。特定の産業の専門様式や別の言語圏の文書を新たに扱うことになったなら検討の対象になります。

多くの場合は足ります。項目の定義を整え抽出のヒントを変えるだけで相当数の問題が解けるため、まずこの段階を試してください。

文書群と項目の数によって異なります。件数より、失敗した事例と例外へ回った案件が含まれているかが重要です。

うまく処理される文書ではなく、失敗した事例と例外へ回った案件を集めてください。検収の履歴がそのまま候補になります。

非識別化が先行する必要があります。加えて学習の環境も統制された場所である必要があり、ネットワーク分離環境では社内網の中で行われる必要があります。

関連用語