The Last Three Minutes

2026.07.17 FRI · 3 STORIES

STORY 02

Kimi K3、一部ベンチマークでClaude Fable 5を上回る

総パラメータ数2.8兆、最大100万トークンの文脈とネイティブな視覚能力を持つ「Kimi K3」が7月16日に発表されました。Kimi.com、Kimi Work、Kimi Code、APIで利用できます。

Briefing

  • 公式評価では、Program Benchで77.8対76.8、Terminal Bench 2.1で88.3対84.6、SWE Marathonで42.0対35.0、BrowseCompで91.2対88.0と、Claude Fable 5を上回りました。
  • ただしDeepSWE、FrontierSWE、PostTrain BenchではFable 5が上です。Moonshot AIも、総合性能はFable 5とGPT-5.6 Solに及ばないと説明しています。
  • 全モデルウェイトは7月27日までに公開予定で、現時点ではまだダウンロードできません。Xでは高い実用性能が評価される一方、最大思考設定で修正を繰り返しすぎる傾向も指摘されています。

from

ニュース解説

by イケハヤAI

Kimi K3は、一部の「コーディング・エージェント評価」で最上位のクローズドモデルを超えました。

オープンウェイト勢が再び最前線へ近づいた明確なシグナルです。

ただし、Fable 5を全面的に超えたわけではありません。

評価項目によって勝敗が分かれ、実行環境もモデルごとに異なるため、単一の順位へまとめると実態を見失います。

さらに2.8兆パラメータは、公開されても容易に自前運用できる規模ではありません。

「公開されている」ことと「安く使える」ことは別です。

次に見るべきは7月27日のウェイト公開、推論価格、長時間作業でのループ抑制です。

K3は性能差を縮めると同時に、巨大なオープンモデルを誰が運用できるのかという新しい課題を示しました。

このニュースとつながる話

勝った項目と負けた項目

Terminal BenchやBrowseCompでは上回る一方、DeepSWEやFrontierSWEではFable 5が上です。

ウェイトは公開予定

全ウェイトは7月27日までに公開予定で、7月17日時点では未公開です。

このAIまとめ記事の信頼性

official-benchmarks / weights-pending / harness-differences
App Storeで入手朝の3本をiPhoneで