千问语音合成模型上线,嘈杂环境下也能克隆特定人声
2026-07-20 18:15 千问

千问语音合成模型上线,嘈杂环境下也能克隆特定人声23

7月20日,阿里千问推出语音合成大模型Qwen-Audio-3.0-TTS。这款产品能让机器生成接近真人的声音,并且可以控制说话的语气、情绪和语速。

新模型提供两个版本,一个侧重快速响应,适合实时对话场景;另一个侧重音质和表现力,适合对声音品质要求较高的制作需求。用户只需输入文字,模型就能直接输出语音。

在全球第三方榜单Artificial Analysis的语音合成评测中,该模型的Plus版本排名第一。

这次升级最明显的变化是支持的语言和方言范围大幅扩大,模型覆盖了16种语言,包括中英日韩以及阿拉伯语、越南语等。

同时还能讲20种中国方言,比如广东话、重庆话、东北话、陕西话、上海话、四川话和云南话等。

研发团队对方言发音做了专门训练,避免出现“带普通话腔”的方言,让每种方言听起来更地道。

在声音控制方面,用户可以在文本中插入简单的标记来控制情绪,比如标注某句话要带笑声、要生气或者要停顿,模型会按照要求调整语气。

之前已经支持通过设定角色风格来影响整段话的情绪,现在可以精确到某个字或词,控制更加灵活。

上一代已有的freestyle自由风格模式依然保留,用户可通过“资深客服”“足球解说员”等角色设定来控制整体表达风格。

声音克隆能力也有提升,以往克隆声音需要提供一段安静环境下录制的音频,新模型可以在嘈杂或混响的环境中提取声音特征,过滤掉背景干扰,保留原声的音色。

生成的语音长度最长可达3分钟,采样质量从24kHz提升到48kHz,声音细节更丰富。模型还内置了一批精品音色,涵盖不同风格、方言和小语种,用户可以直接选用。

在多语种表现上,根据CV3-Eval基准测试,新模型在16种语言的词错误率评测中,有10种语言达到行业最佳水平;在说话人相似度方面,Plus版本在所有16种语言中均排名第一。这意味着不同语种的合成语音,发音准确性和声音还原度都有保障。

从应用角度看,这项技术可以用于有声内容制作、智能客服、虚拟主播、语音助手等场景。目前两款模型已经在阿里云百炼平台开放,开发者和企业用户可以直接调用。

88.jpg