谷歌推出最先进实时音频模型
2026-09-16 09:49 谷歌

谷歌把旗下Gemini模型的战场从文字和代码推进到了实时语音。当地时间9月15日,谷歌宣布推出Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking两款实时音频模型,并称这是其目前最先进的实时对话模型。两款模型不仅可以进行更加自然、流畅的语音交流,还能在对话不中断的情况下调用工具、处理视觉信息和执行复杂任务。
这意味着,谷歌正在尝试让实时语音AI从此前的“语音版聊天机器人”,进一步变成能够听懂、思考、调用工具并把事情做完的语音智能体(Agent)。

88.jpg