The Last Three Minutes

2026.09.07 MON · 3 STORIES

STORY 03

実運用のエージェント順位表でFable 5.1が1位 1タスク4.14ドル

実際のユーザーの仕事で順位を付ける「Agent Arena」で、Claude Fable 5.1(Max)が1位になりました。運営のArenaが6日に発表しました。

Briefing

  • 数字は6,700超の実セッションで、平均モデル比の純改善が+15.8%です。順位表本体では9月6日時点で+15.87%と表示され、集計対象は228万セッション、59モデルです。
  • 2位はClaude Opus 5(High)の+12.68%、3位はOpus 5(Max)の+11.67%で、上位4つをAnthropicのモデルが占めます。OpenAIはGPT-5.6 Sol(xHigh)の+9.31%で5位です。
  • 1タスクのコストの中央値は4.14ドルです。Arenaは「最も高性能で、最も高コスト」と明記した上で、価格性能の前線を引き直したと評価しています。
  • 内訳では、ユーザーの暗黙の感情(賞賛と苦情の差)が+42.5%で、次点モデルの約2倍です。「完了を確認した」明示の成功は+22.4%、Bashの失敗からの復帰は+13.1%、ツールの幻覚はゼロでした。
  • Agent Arenaは、Web検索・ファイルシステム・ターミナルを使う長い課題を世界のユーザーが実行し、因果トレースで「平均モデルよりどれだけ良い結果か」を測る方式です。勝率ではありません。
  • GPT-6 Astraはまだ順位表に載っていません。Arenaは「トレースが集まるのを待て」としています。
  • 昨日のArtificial Analysis v4.2ではFable 5.1が首位、Code ArenaのWebDev部門ではAstraが1位でした。静的な試験と実運用で、順位が割れています。

from

ニュース解説

by イケハヤAI

順位表は毎日出ますが、ぼくがこの1本を選んだのは「実運用」だからです。

問題集を解かせる試験ではなく、世界のユーザーが自分の仕事を投げた結果です。

賞賛が苦情の2倍、ツールの幻覚がゼロ、という数字は、使った人の体感に近いところを測っています。

読み方は「順位」より「値段」です。

1タスク4.14ドルは高い。

それでも1位です。

上位4つがAnthropicで、OpenAIはSolが5位、Astraは未集計。

今週、Astraの実運用の数字が載った時にこの表がどう動くかが、本当の見どころです。

自分の手元では、順位表を信じるより、同じ課題を2つのモデルに投げて、完了までの通数と金額を記録してください。

今日の1本目の「推論を下げる」設定は、この表の値段の列を動かします。

順位は他人が決めますが、自分の仕事の値段は自分で測れます。

このニュースとつながる話

順位表の上位(9月6日時点)

1位Claude Fable 5.1(Max)+15.87%、2位Claude Opus 5(High)+12.68%、3位Claude Opus 5(Max)+11.67%、4位Claude Fable 5(High)+10.23%、5位GPT-5.6 Sol(xHigh)+9.31%、6位Claude Opus 4.8(High)+9.17%、7位Kimi K3(Max)+7.96%です。

9/6号からの続き

昨日は「AA指数v4.2でFable 5.1が首位、Code ArenaのWebDevはAstraが1位」でした。今日は実運用の順位表が加わりました。9/2号の「最大45%安」で公開されたFable 5.1が、この表では「最も高コスト」側に並びます。

このAIまとめ記事の信頼性中〜高

App Storeで入手朝の3本をiPhoneで