谷歌推出最先进实时音频模型
谷歌把旗下Gemini模型的战场从文字和代码推进到了实时语音。当地时间9月15日,谷歌宣布推出Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking两款实时音频模型,并称这是其目前最先进的实时对话模型。两款模型不仅可以进行更加自然、流畅的语音交流,还能在对话不中断的情况下调用工具、处理视觉信息和执行复杂任务。
这意味着,谷歌正在尝试让实时语音AI从此前的“语音版聊天机器人”,进一步变成能够听懂、思考、调用工具并把事情做完的语音智能体(Agent)。
[本文为作者独立观点,不代表i黑马立场。如需转载请联系微信公众号(ID:iheima)授权,未经授权,转载必究。]



