AI研修 大企業実務者向け / 第7章: AIエージェントのセキュリティと企業ガバナンス
機密漏洩防止と安全評価ベンチマーク
無料公開レッスン / 読了目安 2 分
自律型エージェントは、複数ツールの連携やRAGの検索過程で、意図せず機密情報や個人情報(PII)を外部へ露呈・推論されるリスク(MosaicLeaksなど)を孕んでいます。これらを未然に防ぐため、Gemma 4の学習フェーズでは「Sensitive Data Filtering(感度データフィルタリング)」やCSAMフィルタリングが自動適用され、トレーニングセットから事前に機密情報や個人情報(PII)が徹底的に排除されています。
また、自社の安全ガバナンスが有効に機能しているかを客観的に評価するためには、安全評価ベンチマークの特性を正しく理解する必要があります。AI評価システム「BenchMIRT」の解析によれば、危険なデュアルユース知識(生物兵器やサイバー攻撃手法)をテストする「WMDP」や、有害な要求への耐性を測る「HarmBench」などは、単純な安全性だけでなくモデルの「一般推論能力(General reasoning)」とも深く紐づいています。実務者は、ベンチマーク上の安全性スコアを過信せず、自動フィルタリングと、自社のコンプライアンス要件に合わせた「カスタマイズ可能な安全モデル(Nemotron 3.5 Content Safetyなど)」の導入を組み合わせることが肝要です。

関連動画
iPhoneは本当に安全?iOS最新脆弱性とAI時代のセキュリティ
【1分生成AIニュース 3月25日 】未成年×生成AI、これからの新常識は「安全を後付けしない」。#生成ai #最新情報 #1分AIニュース