Google在9月15日推出了两款语音模型:Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking。根据Gemini API官方更新日志,这两款产品同日正式上线(GA),其定位为Live API的audio-to-audio模型,意味着输入与输出均为语音,专为即时语音应用而设计。
官方日志把两者的取舍写得很直接。 Gemini 3.8 Live(型号gemini-3.8-live)是多数低延迟语音代理与即时对话的预设选项,强调不因推理而产生延迟,特性包括交错式推理、预设非同步函式呼叫,以及完整的工作阶段用户端内容更新。
Gemini 3.8 Live Extended Thinking(型号gemini-3.8-live-extended-thinking)则是高推理版本,支援在即时语音互动进行的同时于背景推理,官方建议在需要较高背景推理能力时使用。换句话说,前者把延迟压到最低,后者容许模型一边对话一边想得更久。
Google DeepMind 在官方帐号的贴文中列出两款模型的共同特性:升级的推理能力、接近即时的视觉理解、97 种语言的自动侦测,以及背景工具呼叫且不中断对话。针对Extended Thinking 版本,贴文另外说明它在最困难的任务上提供更高的效能与精确度,并会在执行过程中描述任务进度,让对话不致中断。
贴文示范的情境是把3.8 Live Extended Thinking 当成程式设计家教。使用管道方面,一般使用者可在Gemini App 的Gemini Live 中使用,开发者则透过Gemini API 与Google AI Studio 接入。
这是Gemini 3.8 系列在两周内的第二次动作。依同一份更新日志,Gemini 3.8 Flash 于9 月2 日正式上线,主打长周期软件工程、自主代理与复杂企业工作流程。 9 月3 日则是音乐生成模型Lyria 3.5 上线。