Gemini 3.8 Live上线:语音模型分低延迟与高推理两款


Google 在9 月15 日推出两款语音模型Gemini 3.8 Live 与Gemini 3.8 Live Extended Thinking。依Gemini API 官方更新日志,两款同日正式上线(GA),定位是走Live API 的audio-to-audio 模型,也就是输入与输出都直接是语音,用于即时语音应用。

两款的分工:一款抢低延迟,一款换取推理深度

官方日志把两者的取舍写得很直接。 Gemini 3.8 Live(型号gemini-3.8-live)是多数低延迟语音代理与即时对话的预设选项,强调不因推理而产生延迟,特性包括交错式推理、预设非同步函式呼叫,以及完整的工作阶段用户端内容更新。

Gemini 3.8 Live Extended Thinking(型号gemini-3.8-live-extended-thinking)则是高推理版本,支援在即时语音互动进行的同时于背景推理,官方建议在需要较高背景推理能力时使用。换句话说,前者把延迟压到最低,后者容许模型一边对话一边想得更久。

官方列出的四项共同能力

Google DeepMind 在官方帐号的贴文中列出两款模型的共同特性:升级的推理能力、接近即时的视觉理解、97 种语言的自动侦测,以及背景工具呼叫且不中断对话。针对Extended Thinking 版本,贴文另外说明它在最困难的任务上提供更高的效能与精确度,并会在执行过程中描述任务进度,让对话不致中断。

贴文示范的情境是把3.8 Live Extended Thinking 当成程式设计家教。使用管道方面,一般使用者可在Gemini App 的Gemini Live 中使用,开发者则透过Gemini API 与Google AI Studio 接入。

两周内第二款3.8 系列模型

这是Gemini 3.8 系列在两周内的第二次动作。依同一份更新日志,Gemini 3.8 Flash 于9 月2 日正式上线,主打长周期软件工程、自主代理与复杂企业工作流程。 9 月3 日则是音乐生成模型Lyria 3.5 上线。

本文链接地址:https://www.wwsww.cn/rgzn/41260.html
郑重声明:本文版权归原作者所有,转载文章仅为传播更多信息之目的,如作者信息标记有误,请第一时间联系我们修改或删除,多谢。