Google在2026年9月23日和24日分别介绍Gemini 3.8 Text-to-Speech与带Live Avatar的Gemini 3.8 Live。前者强化语音生成与表现控制,后者把实时声音、视觉形象和工具协同结合起来,面向不同的内容制作与企业交互场景。

两项更新对应两种产品需求

Text-to-Speech主要处理“把内容说出来”,例如为一段脚本生成适合场景的声音;Live则处理“在互动中持续交流”,需要听取输入、响应打断、理解上下文并调用工具。两者虽然都涉及语音,但面向的工作流程不同。制作课程音频通常更关注表达一致与反复修改,实时客服或引导则更关注响应节奏、上下文连续和任务执行,不宜用同一个指标评价全部体验。

Live Avatar增加了视觉表达这一层

根据9月24日的官方介绍,Live Avatar为Gemini 3.8 Live加入接近实时的视觉角色,配合说话过程呈现口型与表情,并支持可被打断的交流与异步工具执行。官方公布的企业入口包括Gemini Enterprise,定制Avatar另有企业申请安排。视觉角色可能让说明和引导更容易被理解,但具体可用范围需要按照企业资格核对,不能据此认为所有个人Gemini账号都已有同样入口。

TTS更新侧重语音设计与脚本表现

9月23日介绍的Gemini 3.8 Text-to-Speech包含Flash与Flash-Lite方向,并强调可用自然语言描述声音,以及逐句控制表现方式。对于品牌视频、培训课程和产品讲解,创作者能够先确定整体语气,再围绕段落节奏修改。官方还介绍了音频中的SynthID标记。声音生成是否适合正式发布,仍要由制作方检查读音、人物称谓、语境和素材授权,避免只听开头就认定整段合格。

实时场景中,工具协同比形象更关键

Google在9月的开发者说明中讨论实时语音、视觉上下文和异步工具执行。一个有用的交互助手需要在查询资料或处理后台操作时保持交流,也需要向用户解释下一步是什么。以产品咨询为例,视觉形象可以承担沟通入口,库存、订单和服务规则则仍来自业务系统。把展示层、模型层和业务数据分开设计,才能判断回答出错时应修改哪一部分。

应用解读:先试一个可衡量的流程

企业可以从固定内容的说明流程开始,例如设备操作培训、展厅导览或产品问答,先确定资料范围和无法回答时的处理方式。验收时除了语言自然程度,还应记录用户打断后是否恢复正确主题、查询结果是否准确、延迟是否影响沟通,以及复杂问题能否转交人员处理。若视觉人物吸引注意但无法完成实际问题,体验仍容易在短暂新鲜感后下降。

品牌观察:多模态走向持续交互

这两项更新显示Gemini正在把语音生成、实时对话、视觉呈现和外部工具组合起来。对品牌运营者来说,机会是让同一份知识材料进入音频制作与互动服务;实际落地则需要分别管理内容版本、权限和服务质量。本文引用官方产品说明,未进行独立延迟或准确率测试。地区、企业申请、开发者接口和消费端应用的开放节奏不同,应按具体入口判断可用性。

信息来源

常见问题

Live Avatar是否等同于普通Gemini聊天新增头像?

官方介绍的是具有实时语音、视觉表现及工具协同的交互能力,企业入口和定制申请有各自范围,不能直接推定个人账号已有。

制作配音与实时客服应选择同一能力吗?

配音关注脚本和表达控制,实时客服关注持续交流和业务协同,应按流程选择并分别验收。