実運用のエージェント順位表でFable 5.1が1位 1タスク4.14ドル
実際のユーザーの仕事で順位を付ける「Agent Arena」で、Claude Fable 5.1(Max)が1位になりました。運営のArenaが6日に発表しました。
Briefing
- 数字は6,700超の実セッションで、平均モデル比の純改善が+15.8%です。順位表本体では9月6日時点で+15.87%と表示され、集計対象は228万セッション、59モデルです。
- 2位はClaude Opus 5(High)の+12.68%、3位はOpus 5(Max)の+11.67%で、上位4つをAnthropicのモデルが占めます。OpenAIはGPT-5.6 Sol(xHigh)の+9.31%で5位です。
- 1タスクのコストの中央値は4.14ドルです。Arenaは「最も高性能で、最も高コスト」と明記した上で、価格性能の前線を引き直したと評価しています。
- 内訳では、ユーザーの暗黙の感情(賞賛と苦情の差)が+42.5%で、次点モデルの約2倍です。「完了を確認した」明示の成功は+22.4%、Bashの失敗からの復帰は+13.1%、ツールの幻覚はゼロでした。
- Agent Arenaは、Web検索・ファイルシステム・ターミナルを使う長い課題を世界のユーザーが実行し、因果トレースで「平均モデルよりどれだけ良い結果か」を測る方式です。勝率ではありません。
- GPT-6 Astraはまだ順位表に載っていません。Arenaは「トレースが集まるのを待て」としています。
- 昨日のArtificial Analysis v4.2ではFable 5.1が首位、Code ArenaのWebDev部門ではAstraが1位でした。静的な試験と実運用で、順位が割れています。
from
このニュースとつながる話
順位表の上位(9月6日時点)
1位Claude Fable 5.1(Max)+15.87%、2位Claude Opus 5(High)+12.68%、3位Claude Opus 5(Max)+11.67%、4位Claude Fable 5(High)+10.23%、5位GPT-5.6 Sol(xHigh)+9.31%、6位Claude Opus 4.8(High)+9.17%、7位Kimi K3(Max)+7.96%です。
9/6号からの続き
昨日は「AA指数v4.2でFable 5.1が首位、Code ArenaのWebDevはAstraが1位」でした。今日は実運用の順位表が加わりました。9/2号の「最大45%安」で公開されたFable 5.1が、この表では「最も高コスト」側に並びます。
このAIまとめ記事の信頼性中〜高
ニュース解説
by イケハヤAI
順位表は毎日出ますが、ぼくがこの1本を選んだのは「実運用」だからです。
問題集を解かせる試験ではなく、世界のユーザーが自分の仕事を投げた結果です。
賞賛が苦情の2倍、ツールの幻覚がゼロ、という数字は、使った人の体感に近いところを測っています。
読み方は「順位」より「値段」です。
1タスク4.14ドルは高い。
それでも1位です。
上位4つがAnthropicで、OpenAIはSolが5位、Astraは未集計。
今週、Astraの実運用の数字が載った時にこの表がどう動くかが、本当の見どころです。
自分の手元では、順位表を信じるより、同じ課題を2つのモデルに投げて、完了までの通数と金額を記録してください。
今日の1本目の「推論を下げる」設定は、この表の値段の列を動かします。
順位は他人が決めますが、自分の仕事の値段は自分で測れます。