Google 发布 Gemini 3.8 Flash TTS语音模型 让你像导演一样逐行指导配音
新的文字转语音模型支持用描述设计声音、用短录音复刻声音,并用剧本标记控制语气、叹气、笑声和对方插话。本文讲清两款模型的区别、脚本写法、评测里的领先与落后,以及在哪能用。
Google 给 Gemini 家族加了两个新的文字转语音(TTS)模型:Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS。
以前用 TTS,流程基本是:从几十个预设声音里挑一个,把文字丢进去,出来一段念得还算顺的音频。想要"紧张一点""这句笑着说""对方在旁边嗯一声",要么做不到,要么得后期剪。
这次 Google 想把这件事变成"配音工作室":声音可以用一句话描述出来,也可以拿 30 秒录音复刻;每一句台词怎么演,可以像写剧本一样逐行标注;两个角色的对话、插话、叹气、笑声,一份脚本就能生成。
两个模型:一个管"演得好",一个管"量大便宜"
两个模型分工很明确:
| Gemini 3.8 Flash TTS | Gemini 3.8 Flash-Lite TTS | |
|---|---|---|
| 定位 | 深度创意导演、角色设计 | 大批量、低成本规模化 |
| 典型用途 | 游戏角色、沉浸式有声书、播客、互动媒体 | 大批量配音、音频内容生产、语音 Agent |
| 从零设计新声音 | 支持 | 博客只在 Flash 下介绍这项能力 |
| 逐行导演、双人对话、非语言标签 | 支持 | 支持 |
| 普通用户在哪用到 | Gemini Notebook | Google Vids |
简单说:要做角色、做戏,选 Flash;要一天生成成千上万条配音或客服语音,选 Flash-Lite。Google 没有在发布博客里给出两者的价格。
值得注意的是,Flash-Lite 并不是"缩水版"。在后面会讲到的几项评测里,它和 Flash 的分数几乎贴着走,在英语等三种语言的盲听偏好里甚至排在 Flash 前面。
这两个模型属于 Google 正在扩充的 Gemini Audio 家族,之前已经有 3.5 Live Translate(实时翻译)、3.5 Transcribe(转写)、3.8 Live 和 3.8 Live Extended Thinking(实时语音对话)。
想要什么声音,用一句话描述出来
过去的 TTS 只能"选"声音,这次 Flash 可以"造"声音。Google 管这叫声音设计(Voice Design):用自然语言写清角色、口音和声音特点,模型从零生成一个新声音,覆盖 100 多种语言和方言。
Google 放了几段示例,描述都很短:
- "墨尔本来的高能量 DJ":生成的是一口澳洲腔的电台主持,语速快、情绪高,"All right, Melbourne... Heaps of great music on the way for you",连 heaps 这种澳洲口语都带上了。
- "超级尖细、单调的机器人":整段"alert alert system status report major malfunction..."没有任何起伏,就是老科幻片里的机器播报。
- "日本龙":一条被打扰了沉睡的龙,自称「老夫」,用日语质问闯入者:"你是小看了老夫的沉睡,还是……终究只是出于好奇?"
最直观的是一段游戏演示。传统游戏的角色定制通常只到外观,声音最多给几个预设。演示里,开发者在"Voice Design"输入框里写:
Deep gravely voice that shows he has been through many battles. Fast and booming. (低沉沙哑、听得出身经百战的声音,语速快、声如洪钟。)
点"Create Voice",几秒后一个骑士声念出台词"You shall not pass these gates, demon, for I have battled worse than thee"。接着他把描述改成"音调高、带王族气质的公主",同一句台词马上换成了公主的声音。玩家捏脸之后,也能"捏声音"了。
围绕"造声音",还有几项配套:
- 声音库变大:原来 30 个预设声音,现在有 2000 多个可以直接用的声音,包括墨西哥西班牙语、魁北克法语、苏格兰英语这类地区变体。
- 存下来反复用:设计好的声音可以保存管理。做系列内容时这点很重要:第 1 集和第 50 集的主角得是同一个声音,Google 说能做到"漂移最小"。
- 声音微调(即将推出):从声音库挑一个现成声音,再用提示词调音色、音高、语速和口音,比如"加一点美国南方口音""说得柔和一些"。
用一段录音复刻自己的声音
另一种"得到声音"的方式是声音复刻:拿一段你自己的声音,或者你有权使用的声音,生成一个能念任意文字的数字版本。博客写的是只需 30 秒音频样本;AI Studio 演示界面则建议录 20 秒左右的自然讲述,并提示"讲个故事,别念成单调的一条线"。
演示里的流程是这样的:
- 录样本:照着界面给的一段短文(一个灯塔看守人望着海平线的小故事)读 20 秒左右。
- 验证是你本人:再朗读一句同意声明:"I am the owner of this voice and I consent to Google using this voice to create a synthetic voice model."(我是这个声音的主人,同意 Google 用它创建合成声音模型。)系统会核对这句同意录音和前面的样本是不是同一个人。
- 生成并保存:分析完成后,复刻的声音会说一句"Hi there! I am your newly replicated voice",你给它起个名字,存进自己的声音库,之后在 Gemini API 里调用。
第 2 步就是 Google 说的同意验证:声音主人必须亲口录一段同意,而且要和参考声音匹配,才能创建。这是为了防止有人拿别人的录音偷偷克隆。
另外,AI Studio 里的声音复刻目前在美国伊利诺伊州、得克萨斯州,欧洲经济区、英国、瑞士和印度不可用。在这些地区的开发者暂时用不上它。
像写剧本一样,告诉它每一句怎么演
选好声音后,两个模型都支持逐行导演:你在脚本里写舞台指示,告诉它这一句是嘟囔、是安慰还是耳语;也可以不写,让 Gemini 自己根据台词判断怎么念。
从 Google 的演示画面看,脚本里用了三种标记:
- 方括号
[ ]:表演指示。写在一句台词前面,说明语气和状态,比如[whispering](耳语)、[reassuringly](安慰地),也可以写成一长串描述。 - 尖括号
< >:非语言声音。插在台词中间,比如<sigh>叹气、<laughs>笑、<gasp>倒吸一口气、<breath>呼吸声。 - 竖线
| |:另一个人的插话和附和。比如|mhm|、|yeah|,用来做"对方在旁边嗯一声"这种听者反馈(Google 叫 backchanneling,指对话里听的人发出的"嗯""对"这类回应),也能卡准笑点和反应的节奏。
先看一个单人客服的例子。同一个客服在四句话里换了四种状态:
Speaker 1: [muttering]
tu...tu...tu....hang on a second, let me find that order status <sigh>
Speaker 1: [reassuringly]
yeah....this order never really got delivered. Sorry for that. Let me update and reschedule this order....
Speaker 1: [whispering]
give me one moment...
Speaker 1: [warm][neutral][prosody="60%"]
I just updated the status and rescheduled the delivery.
听起来就像一个真人客服:边查边嘟囔、叹口气,发现问题后放软语气道歉,操作时小声说"稍等",最后用平稳温和的语气告诉你搞定了。最后一行还出现了 [prosody="60%"] 这样的参数写法,博客没解释它具体控制什么,从字面看和语调、节奏的幅度有关。
再看一个双人恐怖场景,三种标记全用上了。两个人夜里在树林里,发现有东西跟着他们:
Speaker 1: [high-pitched and frantic, trying to rationalize while escalating into pure, unadulterated terror]
Maybe it's just a deer? |That's not| <breath> People say |That's not a deer.| it's always deer. <nervous laugh> But it's... it's staying right on the edge of the light. |Stop.| It's following us. <gasp> Look, right there |Where?| by the pine!
Speaker 2: [strangled and horrified, voice cracking as the realization of a threat sinks in]
I don't see... |There!| <gasp> Oh my god, what is |What is that?| that? <breath> It's too big. That's not |That's not| an animal. It's just standing there.
这里有两个细节很关键。
第一,表演指示写的是"情绪怎么变",不只是一个静态情绪。"尖声慌乱,一边试图自我安慰,一边升级成纯粹的恐惧",这是一整段表演弧线。后面还有"低声急促,咬着牙勉强保持镇定""抽泣崩溃,随着威胁逼近音量和语速越来越高"。
第二,竖线里的插话会和主台词重叠。Speaker 1 说"Maybe it's just a deer?"时,Speaker 2 已经在插嘴"That's not"。真人吵架、害怕、抢话时就是这样,一人一句轮流念的 TTS 做不出这种感觉。
这背后是几项底层能力:
- 原生双人场景:一份脚本直接驱动两人多轮对话,两个声音区分清楚,轮流和插话自然。适合播客对谈和广播剧。
- 长内容生成:连续生成数小时音频,音质、节奏和角色音色保持稳定,说话人漂移小。做有声书时,最怕的就是念到第十章主角声音变了。
- 非语言声音与插话:就是上面尖括号和竖线的能力,Google 专门强调可以用来卡喜剧节奏和反应点。
Google 还给了两个更完整的"导演"演示。
一个老警探的独白。一个叫 Monologue 的演示应用把独白拆成 16 段,每段上面有一行表演说明,比如"得意、放松,靠在金属椅上,慢悠悠带着笑意的布鲁克林腔""最大音量咆哮,青筋暴起,被背叛的愤怒""心碎,声音颤抖破音,强忍眼泪"。台词里夹着 <chuckle>、<short pause>、<breath>,甚至用音标 /kəˈnɑːrsi/ 标出地名 Canarsie 的读法,防止模型念错。结果是一个老警探从嚣张、到慌乱、到崩溃、最后交代线索的完整情绪弧线。
剧本围读(Table Read)。上传一个剧本,给每个角色分配声音(比如"温暖、有感染力的男中音"和"温柔、有同理心的女中音"),整场戏就被演出来。它的口号是:"台词一个字不改,只改演法。"演示里,创作者把一句台词的舞台指示改成"抱怨但语速自然",重新生成,同一句话就换了一种演法。对编剧和导演来说,这相当于随时有一组能反复试戏的配音演员。
如果你想自己试,可以照下面这个结构写脚本:先写说话人,再在方括号里写这一句的表演指示(包括情绪怎么变化),台词中间用尖括号插入非语言声音,用竖线写另一个人的插话。
Speaker 1: [表演指示:情绪、音量、语速,以及这一句里情绪怎样变化]
台词…… <sigh> 台词…… |另一个人的插话| 台词……
Speaker 2: [表演指示]
台词…… <laughs> 台词…… |mhm| 台词……
评测成绩:领先在哪,落后在哪
Google 引用了两家第三方评测:Hume AI 的榜单和 Voice Arena 的盲听投票。三张表都来自 Google 发布博客,数字越高越好。
第一张:Hume AI 声音设计榜,比的是"用文字描述造声音"这件事,只有三家参赛:Gemini 3.8 Flash TTS、ElevenLabs Voice Design v3 和 Inworld Voice Design。
| 指标 | Gemini 3.8 Flash | ElevenLabs | Inworld |
|---|---|---|---|
| 总分(英语) | 71.4 | 70.8 | 69.8 |
| 多语言 | 3.82 | 3.65 | 3.57 |
| 口音 | 60.8 | 45.4 | 35.8 |
| 声音特质 | 74.6 | 76.6 | 76.3 |
总分 Gemini 第一,但只比 ElevenLabs 高 0.6,差距很小。真正拉开的是口音:60.8 对 45.4,高了 15 分以上。这和前面"墨尔本 DJ""苏格兰英语"这些例子对得上,想要特定地区腔调时它的优势最明显。反过来,"声音特质"这一项 Gemini 是三家里最低的。
第二张:Hume AI 质量榜,比的是 TTS 整体表现。总分的定义是"可靠性 × 表现力",也就是既要念得稳,又要念得有感情;风格标签控制测的是单个标签的听话程度。
| 模型 | 总分 | 拟人变化 | 多说话人 | 风格标签控制 |
|---|---|---|---|---|
| Gemini 3.8 Flash | 0.920 | 4.58 | 4.14 | 4.34 |
| Gemini 3.8 Flash-Lite | 0.914 | 4.51 | 4.10 | 4.32 |
| Gemini 3.1 Flash(上一代) | 0.783 | 3.95 | 3.60 | 4.31 |
| ElevenLabs v3 | 0.706 | 5.00 | 3.85 | 3.89 |
| ElevenLabs v3 对话版 | 0.769 | 4.97 | 无数据 | 3.97 |
| Cartesia Sonic 3.6 | 0.840 | 3.40 | 无数据 | 3.37 |
| OpenAI gpt-4o-mini-tts | 0.740 | 4.22 | 无数据 | 无数据 |
| Inworld TTS-2 | 0.576 | 3.76 | 无数据 | 4.15 |
这张表能看出三件事:
- 比上一代进步很大:总分从 3.1 Flash 的 0.783 升到 0.920,多说话人从 3.60 升到 4.14,对应 Google 说的"双人剧本控制大幅改进"。
- Flash-Lite 几乎追平 Flash:每一项差距都在 0.07 以内。如果你的场景看重成本,Flash-Lite 的质量损失很小。
- "拟人变化"ElevenLabs 更强:这项衡量的是多轮对话里语气变化像不像真人,太平淡或太夸张都会扣分。ElevenLabs v3 拿了满分 5.00,Gemini 是 4.58;但在"可靠性 × 表现力"的总分上,ElevenLabs v3 只有 0.706。
第三张:Voice Arena 分语言盲听榜。真人听众在不知道是哪家模型的情况下投票,分数是由投票算出的相对排名分,看谁高谁低即可。参赛的外部模型有 ElevenLabs v3、Cartesia Sonic 3.6 和 OpenAI gpt-4o-mini-tts,下表只列每种语言里分数最高的那一家;OpenAI 在七种语言里都排最后(阿拉伯语为标准阿拉伯语 MSA,Cartesia 在日语、越南语、阿拉伯语没有成绩)。
| 语言 | 3.8 Flash | 3.8 Flash-Lite | 3.1 Flash | 最强外部对手 |
|---|---|---|---|---|
| 英语 | 1061 | 1087 | 1051 | Cartesia 1068 |
| 日语 | 1232 | 1152 | 1148 | ElevenLabs 1048 |
| 巴西葡语 | 1104 | 1134 | 1094 | Cartesia 1080 |
| 越南语 | 1135 | 1156 | 1099 | ElevenLabs 1043 |
| 阿拉伯语 | 1204 | 1181 | 1135 | ElevenLabs 1020 |
| 印地语 | 1106 | 1076 | 1086 | Cartesia 1104 |
| 墨西哥西语 | 1152 | 1146 | 1092 | Cartesia 1089 |
七种语言,第一名全是 3.8 家族,但两兄弟各赢一半:Flash 赢日语、阿拉伯语、印地语、墨西哥西语;更便宜的 Flash-Lite 反而赢了英语、巴西葡语和越南语。在英语里,Flash 本身只排第三,比 Cartesia 还低 7 分。印地语上 Flash 也只比 Cartesia 高 2 分,基本打平,而且 Flash-Lite(1076)在印地语里还低于上一代 3.1 Flash(1086)。
优势最大的是日语:1232 分,比第二名高出 80 分。这和后面日语开发者的反馈对得上。
要注意,这三份榜单都是 Google 挑出来放在发布博客里的,比较对象和指标由它选择。领先的地方很真实,但也有 ElevenLabs 在"拟人变化""声音特质"上更强这类信息,只有看表才能发现。
已经在用它的公司,看重的是什么
Google 列了一批合作方。开发平台 Agora、LiveKit、Pipecat、Vercel 已经通过 Gemini API 接入,开发者可以在这些平台上直接用它搭语音应用。另有 Figma、HeyGen、Linguana、Wondercraft、99.co、Ollang 等在集成,主要做全球配音、带地方口音的本地化和语音 Agent。
从它们的引语看,大家看重的点比较集中:
- 日语准确度:Katsuyo(活用)的开发者说,别的模型要么"表演过头",要么在日语的音高重音和汉字读音上出错,所以选了 3.8 Flash,情绪化内容和日常对话都最准、最自然。这和 Voice Arena 日语第一的成绩对得上。
- 地方口音:99 Group(99.co)在用它做实时 AI 电话对话,特别提到从新加坡式英语(Singlish)到印尼语的本地语言和口音支持。
- 声音一致性:这是出现最多的词。AI 视频平台 HeyGen 说它的用户已经创建了 2000 多万个自定义声音(这是 HeyGen 平台的累计数),新的声音设计让声音"更一致";为 Simia 应用做角色和世界观的 Transforms.AI 说"声音够稳,才能撑起更深的故事";做 YouTube 视频配音的 Linguana 强调规模化流水线需要的稳定性。
- 有声书:AI 有声书公司 Spoken 先让自己的系统分析书稿里的情绪、口音和角色,再交给 3.8 Flash 念出来,看重它"富有表现力的语调"和"大上下文窗口"。
- 规模化内容生产:播客和音频广告平台 Wondercraft 用的是 Flash-Lite,看重的是一致性和可控性足以支撑批量生产。
在哪能用
两个模型都已开始上线:
| Gemini 3.8 Flash TTS | Gemini 3.8 Flash-Lite TTS | |
|---|---|---|
| 开发者 | Gemini API、Google AI Studio | Gemini API、Google AI Studio |
| 企业 | Gemini Enterprise(即将通过 API 提供) | Gemini Enterprise(即将通过 API 提供) |
| 普通用户 | Gemini Notebook | Google Vids |
开发者最快的体验方式是 Google AI Studio 的语音生成。Google 把它做成了一个声音设计工作台:可以用提示词从零造声音,或者复刻自己的声音,然后直接拖进一个双人剧本编辑器逐行导演。
安全:同意验证和隐形水印
声音克隆最大的风险是被拿去冒充别人。Google 的做法有三层:
- 同意验证:复刻声音前,声音主人必须亲口录一段同意声明,并和参考声音匹配。
- SynthID 水印:所有 Gemini Audio 模型生成的音频都嵌入 Google 的 SynthID 水印。它人耳听不出来,但直接织进音频里,之后可以检测出这段语音是 AI 生成的,用来对抗虚假信息。
- C2PA 凭证:复刻的声音还带 C2PA 内容凭证,这是一个行业通用的"内容来源证明"标准,记录内容由谁、用什么工具生成。
更多安全细节,Google 放在了 Gemini 3.8 Audio 模型卡里。
