米国の生成AI二大勢力であるOpenAIとAnthropicは、最先端フロンティアモデルの暴走防止や悪用阻止を目的とした、前例のない「相互安全性検証協定(Mutual Safety Cross-Evaluation Agreement)」を締結したと共同発表しました。
これまで両社は自社開発モデルのセーフティ検証を独自に行い、一部を国家のAI安全機関(米英AISI等)に共有するにとどまっていましたが、モデルの推論能力と自律行動力が飛躍的に向上したことを受け、競合の垣根を越えた民間主導の相互監査体制へと舵を切りました。
本協定に基づき、両社は次世代モデルのリリース前に、自律的自己複製、サイバー攻撃の自動化、バイオ・化学兵器設計支援といった壊滅的リスク(Catastrophic Risks)に関する評価プロトコルや、内部で発見された脆弱性攻撃プロンプトを機密保持の下で相互に開示・検証します。
これにより、単一企業の見落としを防ぎ、業界最高水準のレッドチーム演習をリリース前のモデルに課すことが可能になります。AI規制が国際的に議論される中、トップランナー同士が自主的な安全基準の統一を主導する動きとして、今後のAI開発秩序に決定的な影響を与える見通しです(一次ソース:OpenAI Newsroom / Anthropic News)。
