米Google DeepMindが開発を進める次世代フラッグシップAIモデル「Gemini 4(Gemini 4.0 Pro)」に関する非公式のベンチマーク予測比較データ(PREDICTED Matrix)が海外AIコミュニティおよびSNS上に流出し、大きな反響を呼んでいます。
流出した比較表によると、未知の視覚・論理パズルを通じて汎用知能を測定する最新指標「ARC-AGI-3」において99.9パーセント超をマークしたほか、先端数学を評価する「FrontierMath Tier 4」で99.1パーセント、自律端末操作を測る「Terminal-Bench 4.0」で62.3パーセントなど、競合のOpenAI GPT-6(Astra)やClaude Opus 5.5を上回る推計値が並んでいます。
本データは非公式の予測値であり数値の正確性は保証されていませんが、先月中旬にLMSYS Chatbot Arenaにおいて通常モデルを遥かに凌駕する超高精度な描画・推論を披露した謎のテストインスタンスの目撃証言とも符合しており、開発者らの関心を惹きつけています。
Google DeepMindは難航したGemini 3.5 Proの単体公開を棚上げし、全計算資源をGemini 4へ集約して事前学習とポストトレーニングを進めていることを公言しています。最高峰のフロンティア知能をめぐる競争が激化する中、年内の早期プレビュー投入に向けた期待が一気に高まっています(一次ソース:Google DeepMind Official / LMSYS Chatbot Arena)。
