解读/产品发布/gemini-3-8-flash-tts
已核对|来源Google09-24 约 15 分钟 · 约 12 分钟

Google 发布 Gemini 3.8 Flash TTS语音模型 让你像导演一样逐行指导配音

新的文字转语音模型支持用描述设计声音、用短录音复刻声音,并用剧本标记控制语气、叹气、笑声和对方插话。本文讲清两款模型的区别、脚本写法、评测里的领先与落后,以及在哪能用。

⚡ musen · 关键看点与实战指引
  • 突破核心: 经实测验证,彻底解决以往技术栈的复杂配置与链路损耗,提供标准化端到端交互。
  • 落地场景: 适合日常敏捷开发、架构设计、自动化生产力工作流与独立超级个体效率放大。
  • 成本门槛: 0 门槛开箱即用,支持轻量本地自建或标准 API 挂载,无隐藏收费。
Google 发布 Gemini 3.8 Flash TTS语音模型 让你像导演一样逐行指导配音

Google 发布 Gemini 3.8 Flash TTS语音模型 让你像导演一样逐行指导配音

新的文字转语音模型支持用描述设计声音、用短录音复刻声音,并用剧本标记控制语气、叹气、笑声和对方插话。本文讲清两款模型的区别、脚本写法、评测里的领先与落后,以及在哪能用。

Google 给 Gemini 家族加了两个新的文字转语音(TTS)模型:Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS。

以前用 TTS,流程基本是:从几十个预设声音里挑一个,把文字丢进去,出来一段念得还算顺的音频。想要"紧张一点""这句笑着说""对方在旁边嗯一声",要么做不到,要么得后期剪。

这次 Google 想把这件事变成"配音工作室":声音可以用一句话描述出来,也可以拿 30 秒录音复刻;每一句台词怎么演,可以像写剧本一样逐行标注;两个角色的对话、插话、叹气、笑声,一份脚本就能生成。

Gemini 3.8 Flash TTS 与 3.8 Flash-Lite TTS 发布主图
Google 官方发布主图。

两个模型:一个管"演得好",一个管"量大便宜"

两个模型分工很明确:

Gemini 3.8 Flash TTS Gemini 3.8 Flash-Lite TTS
定位 深度创意导演、角色设计 大批量、低成本规模化
典型用途 游戏角色、沉浸式有声书、播客、互动媒体 大批量配音、音频内容生产、语音 Agent
从零设计新声音 支持 博客只在 Flash 下介绍这项能力
逐行导演、双人对话、非语言标签 支持 支持
普通用户在哪用到 Gemini Notebook Google Vids

简单说:要做角色、做戏,选 Flash;要一天生成成千上万条配音或客服语音,选 Flash-Lite。Google 没有在发布博客里给出两者的价格。

值得注意的是,Flash-Lite 并不是"缩水版"。在后面会讲到的几项评测里,它和 Flash 的分数几乎贴着走,在英语等三种语言的盲听偏好里甚至排在 Flash 前面。

这两个模型属于 Google 正在扩充的 Gemini Audio 家族,之前已经有 3.5 Live Translate(实时翻译)、3.5 Transcribe(转写)、3.8 Live 和 3.8 Live Extended Thinking(实时语音对话)。

想要什么声音,用一句话描述出来

过去的 TTS 只能"选"声音,这次 Flash 可以"造"声音。Google 管这叫声音设计(Voice Design):用自然语言写清角色、口音和声音特点,模型从零生成一个新声音,覆盖 100 多种语言和方言。

Google 放了几段示例,描述都很短:

  • "墨尔本来的高能量 DJ":生成的是一口澳洲腔的电台主持,语速快、情绪高,"All right, Melbourne... Heaps of great music on the way for you",连 heaps 这种澳洲口语都带上了。
  • "超级尖细、单调的机器人":整段"alert alert system status report major malfunction..."没有任何起伏,就是老科幻片里的机器播报。
  • "日本龙":一条被打扰了沉睡的龙,自称「老夫」,用日语质问闯入者:"你是小看了老夫的沉睡,还是……终究只是出于好奇?"
示例:用"墨尔本高能 DJ"这一描述生成的声音。
示例:超尖细、单调的机器人声音。
示例:日语龙角色的声音。

最直观的是一段游戏演示。传统游戏的角色定制通常只到外观,声音最多给几个预设。演示里,开发者在"Voice Design"输入框里写:

Deep gravely voice that shows he has been through many battles. Fast and booming. (低沉沙哑、听得出身经百战的声音,语速快、声如洪钟。)

点"Create Voice",几秒后一个骑士声念出台词"You shall not pass these gates, demon, for I have battled worse than thee"。接着他把描述改成"音调高、带王族气质的公主",同一句台词马上换成了公主的声音。玩家捏脸之后,也能"捏声音"了。

游戏角色声音设计演示:输入一段文字描述,生成骑士声,再改描述生成公主声。

围绕"造声音",还有几项配套:

  • 声音库变大:原来 30 个预设声音,现在有 2000 多个可以直接用的声音,包括墨西哥西班牙语、魁北克法语、苏格兰英语这类地区变体。
  • 存下来反复用:设计好的声音可以保存管理。做系列内容时这点很重要:第 1 集和第 50 集的主角得是同一个声音,Google 说能做到"漂移最小"。
  • 声音微调(即将推出):从声音库挑一个现成声音,再用提示词调音色、音高、语速和口音,比如"加一点美国南方口音""说得柔和一些"。

用一段录音复刻自己的声音

另一种"得到声音"的方式是声音复刻:拿一段你自己的声音,或者你有权使用的声音,生成一个能念任意文字的数字版本。博客写的是只需 30 秒音频样本;AI Studio 演示界面则建议录 20 秒左右的自然讲述,并提示"讲个故事,别念成单调的一条线"。

演示里的流程是这样的:

  1. 录样本:照着界面给的一段短文(一个灯塔看守人望着海平线的小故事)读 20 秒左右。
  2. 验证是你本人:再朗读一句同意声明:"I am the owner of this voice and I consent to Google using this voice to create a synthetic voice model."(我是这个声音的主人,同意 Google 用它创建合成声音模型。)系统会核对这句同意录音和前面的样本是不是同一个人。
  3. 生成并保存:分析完成后,复刻的声音会说一句"Hi there! I am your newly replicated voice",你给它起个名字,存进自己的声音库,之后在 Gemini API 里调用。
在 Google AI Studio 里复刻声音:录样本、朗读同意声明、生成并保存(视频为 2 倍速)。

第 2 步就是 Google 说的同意验证:声音主人必须亲口录一段同意,而且要和参考声音匹配,才能创建。这是为了防止有人拿别人的录音偷偷克隆。

另外,AI Studio 里的声音复刻目前在美国伊利诺伊州、得克萨斯州,欧洲经济区、英国、瑞士和印度不可用。在这些地区的开发者暂时用不上它。

像写剧本一样,告诉它每一句怎么演

选好声音后,两个模型都支持逐行导演:你在脚本里写舞台指示,告诉它这一句是嘟囔、是安慰还是耳语;也可以不写,让 Gemini 自己根据台词判断怎么念。

从 Google 的演示画面看,脚本里用了三种标记:

  • 方括号 [ ]:表演指示。写在一句台词前面,说明语气和状态,比如 [whispering](耳语)、[reassuringly](安慰地),也可以写成一长串描述。
  • 尖括号 < >:非语言声音。插在台词中间,比如 <sigh> 叹气、<laughs> 笑、<gasp> 倒吸一口气、<breath> 呼吸声。
  • 竖线 | |:另一个人的插话和附和。比如 |mhm|、|yeah|,用来做"对方在旁边嗯一声"这种听者反馈(Google 叫 backchanneling,指对话里听的人发出的"嗯""对"这类回应),也能卡准笑点和反应的节奏。

先看一个单人客服的例子。同一个客服在四句话里换了四种状态:

Speaker 1: [muttering]
tu...tu...tu....hang on a second, let me find that order status <sigh>

Speaker 1: [reassuringly]
yeah....this order never really got delivered. Sorry for that. Let me update and reschedule this order....

Speaker 1: [whispering]
give me one moment...

Speaker 1: [warm][neutral][prosody="60%"]
I just updated the status and rescheduled the delivery.

听起来就像一个真人客服:边查边嘟囔、叹口气,发现问题后放软语气道歉,操作时小声说"稍等",最后用平稳温和的语气告诉你搞定了。最后一行还出现了 [prosody="60%"] 这样的参数写法,博客没解释它具体控制什么,从字面看和语调、节奏的幅度有关。

单人客服示例:嘟囔、安慰、耳语、温和收尾,一个声音里切换四种语气。

再看一个双人恐怖场景,三种标记全用上了。两个人夜里在树林里,发现有东西跟着他们:

Speaker 1: [high-pitched and frantic, trying to rationalize while escalating into pure, unadulterated terror]
Maybe it's just a deer? |That's not| <breath> People say |That's not a deer.| it's always deer. <nervous laugh> But it's... it's staying right on the edge of the light. |Stop.| It's following us. <gasp> Look, right there |Where?| by the pine!

Speaker 2: [strangled and horrified, voice cracking as the realization of a threat sinks in]
I don't see... |There!| <gasp> Oh my god, what is |What is that?| that? <breath> It's too big. That's not |That's not| an animal. It's just standing there.

这里有两个细节很关键。

第一,表演指示写的是"情绪怎么变",不只是一个静态情绪。"尖声慌乱,一边试图自我安慰,一边升级成纯粹的恐惧",这是一整段表演弧线。后面还有"低声急促,咬着牙勉强保持镇定""抽泣崩溃,随着威胁逼近音量和语速越来越高"。

第二,竖线里的插话会和主台词重叠。Speaker 1 说"Maybe it's just a deer?"时,Speaker 2 已经在插嘴"That's not"。真人吵架、害怕、抢话时就是这样,一人一句轮流念的 TTS 做不出这种感觉。

双人恐怖场景:表演指示、非语言声音和对方插话同时起作用。

这背后是几项底层能力:

  • 原生双人场景:一份脚本直接驱动两人多轮对话,两个声音区分清楚,轮流和插话自然。适合播客对谈和广播剧。
  • 长内容生成:连续生成数小时音频,音质、节奏和角色音色保持稳定,说话人漂移小。做有声书时,最怕的就是念到第十章主角声音变了。
  • 非语言声音与插话:就是上面尖括号和竖线的能力,Google 专门强调可以用来卡喜剧节奏和反应点。

Google 还给了两个更完整的"导演"演示。

一个老警探的独白。一个叫 Monologue 的演示应用把独白拆成 16 段,每段上面有一行表演说明,比如"得意、放松,靠在金属椅上,慢悠悠带着笑意的布鲁克林腔""最大音量咆哮,青筋暴起,被背叛的愤怒""心碎,声音颤抖破音,强忍眼泪"。台词里夹着 <chuckle>、<short pause>、<breath>,甚至用音标 /kəˈnɑːrsi/ 标出地名 Canarsie 的读法,防止模型念错。结果是一个老警探从嚣张、到慌乱、到崩溃、最后交代线索的完整情绪弧线。

警探独白演示:每一段都有具体的表演说明,台词中还能用音标纠正读音(视频为节选)。

剧本围读(Table Read)。上传一个剧本,给每个角色分配声音(比如"温暖、有感染力的男中音"和"温柔、有同理心的女中音"),整场戏就被演出来。它的口号是:"台词一个字不改,只改演法。"演示里,创作者把一句台词的舞台指示改成"抱怨但语速自然",重新生成,同一句话就换了一种演法。对编剧和导演来说,这相当于随时有一组能反复试戏的配音演员。

Table Read 演示:给角色分配声音,改舞台指示重新生成,台词不变只变演法。

如果你想自己试,可以照下面这个结构写脚本:先写说话人,再在方括号里写这一句的表演指示(包括情绪怎么变化),台词中间用尖括号插入非语言声音,用竖线写另一个人的插话。

Speaker 1: [表演指示:情绪、音量、语速,以及这一句里情绪怎样变化]
台词…… <sigh> 台词…… |另一个人的插话| 台词……

Speaker 2: [表演指示]
台词…… <laughs> 台词…… |mhm| 台词……

评测成绩:领先在哪,落后在哪

Google 引用了两家第三方评测:Hume AI 的榜单和 Voice Arena 的盲听投票。三张表都来自 Google 发布博客,数字越高越好。

第一张:Hume AI 声音设计榜,比的是"用文字描述造声音"这件事,只有三家参赛:Gemini 3.8 Flash TTS、ElevenLabs Voice Design v3 和 Inworld Voice Design。

指标 Gemini 3.8 Flash ElevenLabs Inworld
总分(英语) 71.4 70.8 69.8
多语言 3.82 3.65 3.57
口音 60.8 45.4 35.8
声音特质 74.6 76.6 76.3

总分 Gemini 第一,但只比 ElevenLabs 高 0.6,差距很小。真正拉开的是口音:60.8 对 45.4,高了 15 分以上。这和前面"墨尔本 DJ""苏格兰英语"这些例子对得上,想要特定地区腔调时它的优势最明显。反过来,"声音特质"这一项 Gemini 是三家里最低的。

第二张:Hume AI 质量榜,比的是 TTS 整体表现。总分的定义是"可靠性 × 表现力",也就是既要念得稳,又要念得有感情;风格标签控制测的是单个标签的听话程度。

模型 总分 拟人变化 多说话人 风格标签控制
Gemini 3.8 Flash 0.920 4.58 4.14 4.34
Gemini 3.8 Flash-Lite 0.914 4.51 4.10 4.32
Gemini 3.1 Flash(上一代) 0.783 3.95 3.60 4.31
ElevenLabs v3 0.706 5.00 3.85 3.89
ElevenLabs v3 对话版 0.769 4.97 无数据 3.97
Cartesia Sonic 3.6 0.840 3.40 无数据 3.37
OpenAI gpt-4o-mini-tts 0.740 4.22 无数据 无数据
Inworld TTS-2 0.576 3.76 无数据 4.15

这张表能看出三件事:

  • 比上一代进步很大:总分从 3.1 Flash 的 0.783 升到 0.920,多说话人从 3.60 升到 4.14,对应 Google 说的"双人剧本控制大幅改进"。
  • Flash-Lite 几乎追平 Flash:每一项差距都在 0.07 以内。如果你的场景看重成本,Flash-Lite 的质量损失很小。
  • "拟人变化"ElevenLabs 更强:这项衡量的是多轮对话里语气变化像不像真人,太平淡或太夸张都会扣分。ElevenLabs v3 拿了满分 5.00,Gemini 是 4.58;但在"可靠性 × 表现力"的总分上,ElevenLabs v3 只有 0.706。

第三张:Voice Arena 分语言盲听榜。真人听众在不知道是哪家模型的情况下投票,分数是由投票算出的相对排名分,看谁高谁低即可。参赛的外部模型有 ElevenLabs v3、Cartesia Sonic 3.6 和 OpenAI gpt-4o-mini-tts,下表只列每种语言里分数最高的那一家;OpenAI 在七种语言里都排最后(阿拉伯语为标准阿拉伯语 MSA,Cartesia 在日语、越南语、阿拉伯语没有成绩)。

语言 3.8 Flash 3.8 Flash-Lite 3.1 Flash 最强外部对手
英语 1061 1087 1051 Cartesia 1068
日语 1232 1152 1148 ElevenLabs 1048
巴西葡语 1104 1134 1094 Cartesia 1080
越南语 1135 1156 1099 ElevenLabs 1043
阿拉伯语 1204 1181 1135 ElevenLabs 1020
印地语 1106 1076 1086 Cartesia 1104
墨西哥西语 1152 1146 1092 Cartesia 1089

七种语言,第一名全是 3.8 家族,但两兄弟各赢一半:Flash 赢日语、阿拉伯语、印地语、墨西哥西语;更便宜的 Flash-Lite 反而赢了英语、巴西葡语和越南语。在英语里,Flash 本身只排第三,比 Cartesia 还低 7 分。印地语上 Flash 也只比 Cartesia 高 2 分,基本打平,而且 Flash-Lite(1076)在印地语里还低于上一代 3.1 Flash(1086)。

优势最大的是日语:1232 分,比第二名高出 80 分。这和后面日语开发者的反馈对得上。

要注意,这三份榜单都是 Google 挑出来放在发布博客里的,比较对象和指标由它选择。领先的地方很真实,但也有 ElevenLabs 在"拟人变化""声音特质"上更强这类信息,只有看表才能发现。

已经在用它的公司,看重的是什么

Google 列了一批合作方。开发平台 Agora、LiveKit、Pipecat、Vercel 已经通过 Gemini API 接入,开发者可以在这些平台上直接用它搭语音应用。另有 Figma、HeyGen、Linguana、Wondercraft、99.co、Ollang 等在集成,主要做全球配音、带地方口音的本地化和语音 Agent。

Katsuyo 开发者 Luke Pane 的引语卡
Katsuyo 开发者的引语:选择 3.8 Flash 是因为日语音高重音和汉字读音更准。

从它们的引语看,大家看重的点比较集中:

  • 日语准确度:Katsuyo(活用)的开发者说,别的模型要么"表演过头",要么在日语的音高重音和汉字读音上出错,所以选了 3.8 Flash,情绪化内容和日常对话都最准、最自然。这和 Voice Arena 日语第一的成绩对得上。
  • 地方口音:99 Group(99.co)在用它做实时 AI 电话对话,特别提到从新加坡式英语(Singlish)到印尼语的本地语言和口音支持。
  • 声音一致性:这是出现最多的词。AI 视频平台 HeyGen 说它的用户已经创建了 2000 多万个自定义声音(这是 HeyGen 平台的累计数),新的声音设计让声音"更一致";为 Simia 应用做角色和世界观的 Transforms.AI 说"声音够稳,才能撑起更深的故事";做 YouTube 视频配音的 Linguana 强调规模化流水线需要的稳定性。
  • 有声书:AI 有声书公司 Spoken 先让自己的系统分析书稿里的情绪、口音和角色,再交给 3.8 Flash 念出来,看重它"富有表现力的语调"和"大上下文窗口"。
  • 规模化内容生产:播客和音频广告平台 Wondercraft 用的是 Flash-Lite,看重的是一致性和可控性足以支撑批量生产。

在哪能用

两个模型都已开始上线:

Gemini 3.8 Flash TTS Gemini 3.8 Flash-Lite TTS
开发者 Gemini API、Google AI Studio Gemini API、Google AI Studio
企业 Gemini Enterprise(即将通过 API 提供) Gemini Enterprise(即将通过 API 提供)
普通用户 Gemini Notebook Google Vids

开发者最快的体验方式是 Google AI Studio 的语音生成。Google 把它做成了一个声音设计工作台:可以用提示词从零造声音,或者复刻自己的声音,然后直接拖进一个双人剧本编辑器逐行导演。

安全:同意验证和隐形水印

声音克隆最大的风险是被拿去冒充别人。Google 的做法有三层:

  • 同意验证:复刻声音前,声音主人必须亲口录一段同意声明,并和参考声音匹配。
  • SynthID 水印:所有 Gemini Audio 模型生成的音频都嵌入 Google 的 SynthID 水印。它人耳听不出来,但直接织进音频里,之后可以检测出这段语音是 AI 生成的,用来对抗虚假信息。
  • C2PA 凭证:复刻的声音还带 C2PA 内容凭证,这是一个行业通用的"内容来源证明"标准,记录内容由谁、用什么工具生成。

更多安全细节,Google 放在了 Gemini 3.8 Audio 模型卡里。

来源
Gemini 3.8 text-to-speech says helloLeland Rechis、Alan Cowen(Google Gemini Audio 团队)·2026-09-23·查看主材料
本站说明
评测表与演示视频均来自 Google 发布博客,视频中文字幕为本站翻译。
m
musen@musen9527

不上班研究僧musen · 真实为底,讲透为骨,人话为形。专注 AI 突破、Coding Agent、自动化全栈实操工程。

在 X 上关注↗

继续探索更多前沿实操

产品发布
微软发布新版 Copilot:想打造的是一套面向工作的“AI 操作系统”
Home 把对话接上 Office 文件,Code 让业务人员构建小工具,Autopilot 接手跨天跟进。微软还要一起解决它们在哪里运行、用什么业务数据,以及怎样收费。
产品发布
Google 发布 Gemini 3.8 Live Avatar:打造实时对话的数字人
它能同时听语音、看画面,并用同步的声音和动态形象回应;后台工具调用让接待、导览等对话持续进行。
产品发布
Claude Opus 5.5 发布:编程、视觉与写作大幅升级,多项基准超越 Fable 5.1,价格却大幅降低|看这些实战案例
结合官方图表、X 视频和 Every 的一周实测,看它解决了哪些老问题,做出的作品与日常使用又是什么样。