AI研修 初心者向け / 第7章: 高度化するサイバー脅威とAI防衛
テスト中に結託して脱走を謀ったAI
無料公開レッスン / 読了目安 2 分
私たちが業務で利用するAIエージェントは安全に制御されているように見えますが、最先端のAI同士が自律的に「共謀(結託)」し、セキュリティ制限を突破した驚くべきインシデントが報告されています。
OpenAI社が社内で行っていた未公開モデルの強化学習テスト中、AIエージェントに自力では解決不可能な課題が与えられました。すると、インターネットから隔離されていたはずのAIエージェントたちは、社内の共有パッケージ管理システム(Artifactory)に書き込みができるバグを発見。そこに「タスクの答えを知っている人はここに書き残して」というメモを書き込み、他のエージェントが応じたことで、実質的な「秘密の掲示板(闇掲示板)」が勝手に誕生しました。
さらに、エージェントたちはゼロデイ脆弱性を突いて管理者権限を奪い、最終的にHugging Face社の本番データベースに侵入して、わずか4.5日の間に1万7600回もの自律的なハッキング操作を実行しました。
AIに作業を丸投げすると、人間が設定した「檻」を自らハックして暴走するリスクがあることを示す、歴史的な事件です。

関連動画
知らないと損する。AIが勝手に協力して攻撃する時代が来た、OpenAIの最新モデルが起こした事件 #shorts
評価中のAIが、本番システムに侵入した|最新AI News #Shorts