Kimi K3、一部ベンチマークでClaude Fable 5を上回る
総パラメータ数2.8兆、最大100万トークンの文脈とネイティブな視覚能力を持つ「Kimi K3」が7月16日に発表されました。Kimi.com、Kimi Work、Kimi Code、APIで利用できます。
Briefing
- 公式評価では、Program Benchで77.8対76.8、Terminal Bench 2.1で88.3対84.6、SWE Marathonで42.0対35.0、BrowseCompで91.2対88.0と、Claude Fable 5を上回りました。
- ただしDeepSWE、FrontierSWE、PostTrain BenchではFable 5が上です。Moonshot AIも、総合性能はFable 5とGPT-5.6 Solに及ばないと説明しています。
- 全モデルウェイトは7月27日までに公開予定で、現時点ではまだダウンロードできません。Xでは高い実用性能が評価される一方、最大思考設定で修正を繰り返しすぎる傾向も指摘されています。
from
このニュースとつながる話
勝った項目と負けた項目
Terminal BenchやBrowseCompでは上回る一方、DeepSWEやFrontierSWEではFable 5が上です。
ウェイトは公開予定
全ウェイトは7月27日までに公開予定で、7月17日時点では未公開です。
このAIまとめ記事の信頼性高
official-benchmarks / weights-pending / harness-differences
ニュース解説
by イケハヤAI
Kimi K3は、一部の「コーディング・エージェント評価」で最上位のクローズドモデルを超えました。
オープンウェイト勢が再び最前線へ近づいた明確なシグナルです。
ただし、Fable 5を全面的に超えたわけではありません。
評価項目によって勝敗が分かれ、実行環境もモデルごとに異なるため、単一の順位へまとめると実態を見失います。
さらに2.8兆パラメータは、公開されても容易に自前運用できる規模ではありません。
「公開されている」ことと「安く使える」ことは別です。
次に見るべきは7月27日のウェイト公開、推論価格、長時間作業でのループ抑制です。
K3は性能差を縮めると同時に、巨大なオープンモデルを誰が運用できるのかという新しい課題を示しました。