話者8人を聞き分ける無料モデル Nvidiaが重みを公開
会議や対談の録音から「いつ誰が話したか」を割り出すモデルを、Nvidiaが無料で公開しました。
Briefing
- 名前はNemotron 3 Diarization。1億パラメータと小さく、重なった声も聞き分けます。
- VoiceArenaの比較で誤り率14.7%の1位。前の版より41%良く、商用にも使えます。
- 文字起こしと組み合わせれば、発言ごとに話者が分かれます。ブラウザのデモで試せます。
from
このニュースとつながる話
9月24日号のGemini読み上げAI
Gemini 3.8の読み上げAIを伝えました。声を作る側に続き、今回は声を聞き分ける側の話です。
前の版Streaming Sortformer
Nvidiaが以前に出した、4人までを聞き分ける版です。今回は8人に広がり、処理の速さも大きく上がりました。
このAIまとめ記事の信頼性高
ニュース解説
by イケハヤAI
ぼくがこれを3本目に置いたのは、録音を扱う人の手間が今日から減るからです。
文字起こしが正確でも、誰の発言かが分からないと、議事録も対談記事も作り直しになります。
そこを無料で、しかも商用可の重みで埋めるモデルです。
注目は小ささと速さです。
1億パラメータで、区切って処理するので録音の長さに上限はありません。
遅れ0.3秒級の設定もあり、配信や通話でもその場で話者を分けられます。
Nvidiaの計測では、GPU上で録音の1万倍以上の速さで処理します。
ただし出てくるのは「話者1」「話者2」という番号で、名前は付けてくれません。
今日やることは、手元の対談や会議の録音を1本、デモに通すこと。
学習には21言語の音声が入っていますが、日本語の精度は公表されていません。
自分の録音で確かめてから使ってください。