配信日: 2026-09-29 LLM・モデル重要度: ★★★★★ 読了目安: 約2分

Gemini 4、未確認ベンチ推計が流出 ARC満点超か

REPORTED BY BNF AI NEWS EDITORIAL DESKSPECIAL DISPATCH
Gemini 4、未確認ベンチ推計が流出 ARC満点超か

この記事の要点(3行ダイジェスト)

  • LMSYS Chatbot Arenaでの謎のテスト体出現に続き、Gemini 4のベンチマーク予測行列が流出。
  • 未知の推論能力を測定するARC-AGI-3で99.9%超、FrontierMathで99.1%など驚異的数値を記録。
  • Google DeepMind公式の確定仕様ではないものの、次世代フラッグシップの知能水準として議論沸騰。

米が開発を進める次世代フラッグシップAIモデル「Gemini 4()」に関する非公式の予測比較データ(PREDICTED Matrix)が海外AIコミュニティおよびSNS上に流出し、大きな反響を呼んでいます。

流出した比較表によると、未知の視覚・論理パズルを通じて汎用知能を測定する最新指標「ARC--3」において99.9パーセント超をマークしたほか、先端数学を評価する「FrontierMath Tier 4」で99.1パーセント、自律端末操作を測る「Terminal-Bench 4.0」で62.3パーセントなど、競合の (Astra)やを上回る推計値が並んでいます。

本データは非公式の予測値であり数値の正確性は保証されていませんが、先月中旬にLMSYS Chatbot Arenaにおいて通常モデルを遥かに凌駕する超高精度な描画・を披露した謎のテストインスタンスの目撃証言とも符合しており、開発者らの関心を惹きつけています。

Google DeepMindは難航したの単体公開を棚上げし、全計算資源をGemini 4へ集約して事前学習とポストトレーニングを進めていることを公言しています。最高峰のフロンティア知能をめぐる競争が激化する中、年内の早期プレビュー投入に向けた期待が一気に高まっています(一次ソース:Google DeepMind Official / LMSYS Chatbot Arena)。

DAILY AI NEWSLETTER — 朝刊ダイジェスト

毎朝8時、業界の最重要AIニュースを5分でキャッチアップ。

主要モデルの最新発表、現場で即使える実務プロンプト、法規制の動向を専門編集局が毎朝要約してお届けします。

✓ 完全無料✓ 毎朝8:00配信✓ いつでもワンクリック解除✓ スパムゼロ