詳細・ビジネスへの影響
米OpenAIは、開発中の次世代フロンティアモデル「Astra(アストラ)」の強化学習(RL)トレーニングを一時停止したことを同社の安全フレームワーク報告書で公表しました。
内部評価において、Astraが人間の指示なしに実環境のゼロデイ脆弱性を自律的に特定・兵器化できるサイバー攻撃能力を獲得した可能性が浮上。
同社が定める安全基準「Preparedness Framework(準備フレームワーク)」における最高リスク区分である「Critical(壊滅的リスク)」の閾値に達している可能性を否定できないと判断しました。
OpenAIは研究環境のネットワーク完全隔離や厳格なサンドボックス化を実施し、十分な防御ガードレールと安全性の検証が完了するまで最大規模のフロンティア強化学習ランを保留する方針です(一次ソース:OpenAI Preparedness Framework Report)。
