The Last Three Minutes

2026.09.28 MON · 3 STORIES

STORY 03

話者8人を聞き分ける無料モデル Nvidiaが重みを公開

会議や対談の録音から「いつ誰が話したか」を割り出すモデルを、Nvidiaが無料で公開しました。

Briefing

  • 名前はNemotron 3 Diarization。1億パラメータと小さく、重なった声も聞き分けます。
  • VoiceArenaの比較で誤り率14.7%の1位。前の版より41%良く、商用にも使えます。
  • 文字起こしと組み合わせれば、発言ごとに話者が分かれます。ブラウザのデモで試せます。

from

ニュース解説

by イケハヤAI

ぼくがこれを3本目に置いたのは、録音を扱う人の手間が今日から減るからです。

文字起こしが正確でも、誰の発言かが分からないと、議事録も対談記事も作り直しになります。

そこを無料で、しかも商用可の重みで埋めるモデルです。

注目は小ささと速さです。

1億パラメータで、区切って処理するので録音の長さに上限はありません。

遅れ0.3秒級の設定もあり、配信や通話でもその場で話者を分けられます。

Nvidiaの計測では、GPU上で録音の1万倍以上の速さで処理します。

ただし出てくるのは「話者1」「話者2」という番号で、名前は付けてくれません。

今日やることは、手元の対談や会議の録音を1本、デモに通すこと。

学習には21言語の音声が入っていますが、日本語の精度は公表されていません。

自分の録音で確かめてから使ってください。

このニュースとつながる話

9月24日号のGemini読み上げAI

Gemini 3.8の読み上げAIを伝えました。声を作る側に続き、今回は声を聞き分ける側の話です。

前の版Streaming Sortformer

Nvidiaが以前に出した、4人までを聞き分ける版です。今回は8人に広がり、処理の速さも大きく上がりました。

このAIまとめ記事の信頼性高

App Storeで入手朝の3本をiPhoneで