Gemini 3.8の読み上げAI 声を文章で作れて1時間0.8ドル
読み上げAIのGemini 3.8 Flash TTSと、軽量版のFlash-Lite TTSが出ました。今日から使えます。
Briefing
- 役柄やなまりを文章で指定して、新しい声を作れます。行ごとの演技指示や2人の掛け合いにも対応。
- 30秒の録音から声を再現できます。声の持ち主の同意の録音が要り、全音声に見えない透かしが入ります。
- 音声の料金は年内なら1時間約0.81ドル、軽量版は0.54ドル。2027年1月から倍になります。
from
このニュースとつながる話
9月16日号のGemini 3.8 Live
音声で会話するGemini 3.8 Liveを伝えました。今回は同じ世代の読み上げ側で、話す声と読む声がそろいました。
同じ日のQwen Audio 3.1
Alibabaは音声認識・読み上げ・会話の5モデルを出し、音声まわりの料金を最大95%下げました。声の値下げ競争が進んでいます。
このAIまとめ記事の信頼性高
ニュース解説
by イケハヤAI
ぼくがこれを本命にしたのは、声が「選ぶもの」から「注文して作るもの」に変わったからです。
これまでGeminiの読み上げは、用意された30種の声から選ぶ形でした。
今回はゲームの登場人物や朗読の語り手を、文章の指示だけで作れます。
日本語の聞き比べでも上位に入ったとGoogleは説明しています。
値段も効きます。
10分の解説動画なら、音声代は0.14ドルほど。
同じ日にAlibabaもQwen Audio 3.1で、音声まわりを最大95%値下げしました。
声の値段は下がる一方です。
一方で、他人の声の再現は本人の同意の録音がないと使えません。
今日やるなら、AI Studioで自分の作品の登場人物を1人、文章で注文してみる。
台本にため息や相づちを書き込み、1分ほど読ませて聞いてください。
The Decoderの試用では雑音や声の揺れが出た回もあったので、長い作品は区切って確かめるのが安全です。