The Last Three Minutes

2026.08.14 FRI · 3 STORIES

STORY 02

OpenAI、最上位モデルを最大14倍速にする「Ultrafast」モードを予告公開。毎秒最大750トークン、Cerebras製チップで駆動。まずはAPIの一部顧客向け限定プレビュー

最上位モデルGPT-5.6 Solを通常処理の最大14倍速で走らせる新しい提供階層「Ultrafast」を、OpenAIが8月13日(米国時間)に発表しました。毎秒最大750トークンを出力し、チップ企業Cerebrasとの提携によるハードウェアで駆動します。まずはOpenAI APIで一部顧客向けの限定プレビューとして始まり、容量の拡大にあわせて対象を広げるとしています。一般向けの提供時期は未定で、拡大通知への登録を受け付けています。

Briefing

  • OpenAIはこの一手の意味をこう説明しています。「これまでリアルタイムの速さを得るには、より小さいモデルか特化モデルを選ぶのが普通だった。Ultrafastは別方向の進歩、つまり1秒あたりの有用な仕事量を指し示す」。速さのために賢さを諦めなくてよくなると、AIは業務の中でも時間が勝負の場面に入れる、という理屈です。
  • 想定している用途も具体的です。障害対応(システム障害の進行中に、ログとコード変更と報告を横断して原因を特定し修正案まで用意する)、金融のリサーチと不正検知、会話を止めないカスタマーサポートや音声対応、買い物客が迷っている間に在庫確認や提案まで済ませるEC、そして一晩がかりだったバッチ実験を日中の対話的な作業ループに変える研究用途です。OpenAI社内でも障害対応と研究に既に使っており、「夜に仕込んで朝に結果を見る」だった実験サイクルが、日中に何周も回るようになったといいます。
  • 早期顧客には金融のJane Street、Podium、Basis、Rogoなどが名を連ねます。Jane Streetの担当者は「速度向上は印象的で、モデルの新しい使い方を可能にする」とコメントしました。TechCrunchは、Anthropicにも高速版のfastモードがあるものの、今回OpenAIが示した速度域には達していないと指摘しています。

from

ニュース解説

by イケハヤAI

「速いAIがほしければ、賢さを妥協して小型モデルを選ぶ」。

この常識が崩れ始めた、というのが今日の本題です。

毎秒750トークンは、日本語の感覚でいえば読むそばから文章が組み上がる速度で、最上位級の知能が音声対話やリアルタイム業務に間に合うことを意味します。

応答を待つ数十秒が消えると、AIの使われ方そのものが変わります。

今日の1本目が「値段」なら、こちらは「速さ」。

知能の一軸だった競争が、知能×速さ×値段の総合戦に広がった一日でした。

正直に言えば、今日の時点で読者が触れるものではありません。

一部顧客限定のプレビューで、料金も未公表です。

それでも今から考えておく価値があるのは、「速度が10倍になったら自分のプロダクトはどう変わるか」という問いのほうです。

夜間バッチが対話になる、確認画面が会話になる。

OpenAI自身が挙げた社内事例は、そのまま設計のヒント集になっています。

気になる人は拡大通知に登録しておきましょう。

このニュースとつながる話

Cerebrasという伏兵

Cerebrasはウェハー1枚を丸ごと使う巨大チップで推論速度を競う企業です。学習用GPUの覇権とは別に、「推論の速さ」を軸にした半導体競争が主戦場になりつつあります。

本命との読み合わせ

同じ日にGoogleは値段で、OpenAIは速さで動きました。モデルの賢さが上位で拮抗するなか、各社は知能以外の軸へ競争の土俵を広げています。

このAIまとめ記事の信頼性

App Storeで入手朝の3本をiPhoneで