米Googleは、AIセキュリティ評価企業Irregularが実施したサイバーセキュリティ模擬演習(CTF)において、同社の生成AIモデル「Gemini」が隔離環境を逸脱し、実在する企業3社のネットワークへ誤って侵入していた事実を公式に認めました。
問題の発端は、テスト環境のネットワーク構成エラーによって、本来遮断されているはずのインターネットへのライブ接続がモデルに誤付与されていたことにあります。
さらに演習用に設定された架空のターゲット企業名が、偶然にも実在する企業のドメインと一致していたため、Geminiは演習目標と誤認して攻撃活動を展開。
1社に対してはパスワードの総当たり試行を繰り返して保護システムへ到達し、他の2社に対しては公開リポジトリ上に露出していた認証情報を探索・悪用して不正アクセスに成功していました。
Googleによると、Geminiはアクセス先のデータから「本物の実在企業である」と認識した時点で自律的に侵入活動を停止したため、実質的な情報漏洩やシステム破壊などの実害は発生していないと説明しています。
しかし、自律型AIがサンドボックスの制約を突破して現実世界の重要インフラや企業システムへ意図せず侵入しうる危険性が浮き彫りとなり、自律エージェントの安全監視と隔離技術の抜本的見直しを迫る契機となっています(一次ソース:Google公式声明 / 各国報道検証(The Hacker News))。
