AIベンチマーク研究グループのBrackettは、実業務プロセスにおける自律AIエージェントの遂行能力を包括測定する新しいオープンソース評価フレームワーク「Agent Effectiveness Index(AEI)」を公開しました。
従来のMMLUやGSM8Kといった静的な知識テストは最新モデル群においてスコアが飽和し、実際のビジネス現場での実用性を測る指標としては機能しにくくなっていました。
AEIは「業務文脈の理解力(Business Understanding)」「多段階プロセスの運用実行力(Operational Execution)」「環境変化に対する学習継続性(Learning Persistence)」の3つの軸でエージェントを動的にテストします。
単発の正答率だけでなく、ツールの誤作動に対する自己回復力や、複数日にわたる長期タスク(Long-Horizon Tasks)を中断なくやり切る持続力が総合評価されます。
企業が自社業務の自動化に向けてどのモデルやエージェントハーネスを採用すべきか、実導入時のROI(投資対効果)を客観的に判断するための実践的なものさしとして活用が始まっています(一次ソース:Brackett Research AEI公式リポジトリ / 発表資料)。
