個人情報の非識別化とは何か:文書を別の用途へ移すための処理の完全整理
個人情報の非識別化とは、文書から個人を特定できる項目を探して隠すか別の値へ置き換え、その文書を学習や検索といった別の用途へ移せるようにする処理です。
データとして使うにはまず取り除く
データとして使うにはまず取り除く必要があります。
文書資産を検索や生成AIへつなごうとする組織が増えています。ところが実際の文書を開いてみると、氏名や住民登録番号、口座番号、住所、連絡先が至るところにあります。申請書と証憑書類は大半が個人情報の塊です。
この状態の文書をそのまま索引へ載せれば、検索の結果に個人情報が露出します。学習に用いればモデルがその値を記憶する危険が生じます。したがって公共データを別の用途へ移す際、非識別化は選択肢ではなく事実上の前提条件になります。順序を守ることも重要です。索引を作った後に処理すれば、原本の値はすでに検索の対象に残っています。
非識別化の正確な定義:画面マスキングと何が違うのか
画面マスキングと非識別化、三つの軸の違い
第一に、適用の地点が異なります。画面マスキングは見せる瞬間に隠します。データには原本の値がそのまま残っています。非識別化はデータそのものを変えます。
第二に、目標が異なります。画面マスキングの目標は閲覧の統制です。非識別化の目標は、そのデータを別の用途へ使えるようにすることです。
第三に、戻せるかどうかが異なります。画面マスキングは権限があれば原本を見られます。非識別化は方式によって戻せなくすることも、別途の対応表を置いて必要なときのみ復元させることもできます。
二つの方法は置き換えの関係にはありません。原本は統制された領域に置いて画面マスキングで閲覧を制限し、検索と分析には非識別化された写しを使う構成が実務でよく見られます。
実際の適用に入る5つの基準
実際の適用に入る5つの基準
第一に、対象の項目を一覧として定めます。氏名や住民登録番号のような明白な項目だけでなく、組み合わせれば個人を特定できる項目まで含める必要があります。所属と職位、生年月日、詳細な住所が併せてあれば特定が可能になります。
第二に、処理の方式を項目ごとに定めます。完全に消すか、一部だけ隠すか、別の値へ置き換えるかによって以降の活用度が変わります。日付をまるごと消せば時系列の分析が不可能になります。
第三に、画像とテキストを併せて扱います。スキャン文書では値が画像の中にあるため、テキストだけを処理すれば原本の画像にそのまま残ります。
第四に、順序を守ります。断片を作り索引へ載せる前に処理する必要があります。
第五に、検証の手続を置きます。自動処理の後に標本を抜き取り、残った項目がないかを人が確認する段階が必要です。
非識別化の実際の適用方法
原本と写しを分けて管理します
非識別化された写しを作ったからといって原本を捨てられるわけではありません。業務上の根拠として原本が必要な場合が大半だからです。
したがって原本は統制された領域に保管し、検索と分析には写しを用いる構成が適切です。二つを同じ場所に置けば、どちらを参照しているのかが曖昧になり、統制そのものが意味を失います。
検証の標本を残します
自動処理の後に人が確認する段階を置くとしても、確認した結果を記録として残さなければ次回の改善につながりません。どの項目が漏れやすいかが分かれば、その項目の処理規則を強化できます。
漏れの多い項目は決まっている場合が少なくありません。手書きで記入された連絡先、表の中に紛れた口座番号、押印の下に隠れた氏名などが代表的です。
国内環境における非識別化
韓国の公共と金融の文書には固有の条件があります。住民登録番号は形式が定まっているため検出が容易ですが、事件の内容や病名のように文脈から個人を推測できる情報は形式で捉えられません。項目の一覧を作る際に、形式で捉えられる項目と文脈で判断すべき項目を分けて整理してください。
加えてネットワーク分離環境では、非識別化の処理も社内網で実行される必要があります。外部サービスへ文書を送って処理する構成は、非識別化の目的そのものと矛盾します。
よくあるご質問
文書を構造化した直後、検索用の断片を作る前に実行してください。索引が作られた後に処理すれば、原本の値が検索の結果に残る可能性があります。
用途によって異なります。画面表示が目的であればマスキングで足り、学習や検索の資料へ移す場合は置換するか削除するほうが安全です。
必要です。値が画像の中にあるため、テキストだけを処理すれば原本の画像にそのまま残ります。
大半の場合は保管が必要です。統制された領域に原本を置き、検索と分析には非識別化された写しを用いる構成が適切です。
標本を抜き取って人が確認する段階を置いてください。漏れやすい項目を把握できれば、処理の規則を強化する根拠になります。