(核心事件日:2026年9月23日,距交付3天|标题去空格=27字符|无可用官方素材)
9月23日,阿里通义千问正式发布 Qwen-Audio-3.1 系列语音大模型,一次性推出五款新模型。同时,Qwen-Audio 全线语音模型价格下调:ASR 降幅达 95%,Realtime 降幅约 85%,TTS 降价约 70%。
五款模型一次推齐
本次升级先对三大核心模型做了全面进化:语音识别(ASR)、语音合成(TTS)、实时语音交互(Realtime)。在此之上,官方推出了两款定位更进一步的模型:音频创作模型 Qwen-Audio-3.1-TTS-Next 与音频理解模型 Qwen-Audio-3.1-ASR-Next。
官方称,五款模型同时推出,形成覆盖“理解-生成-交互-创作”四个环节的完整音频能力栈。从听懂一段音频、合成一段语音,到实时对话、音频内容创作,每个环节都有对应模型承接。
ASR 新增分角色转写与润色
Qwen-Audio-3.1-ASR 是新一代语音识别大模型,增强了多语种、方言识别与上下文理解能力。它新增原生转写润色功能,可自动去除语气词与重复表达,并重组语义,让转写出的文字更顺畅、更有逻辑。
分角色转写是这次 ASR 升级里比较实用的点:转写结果能完整呈现“谁在什么时候说了什么”,为会议、访谈和对话分析提供可追溯的结构化记录。
三档降价,ASR 只剩原来一成不到
官方公布的降价幅度如下:
- ASR(语音识别):降幅达 95%
- Realtime(实时语音交互):降幅约 85%
- TTS(语音合成):降价约 70%
官方表示,调价是为了进一步降低用户使用成本。对会议纪要、字幕制作、客服质检这类以语音转写为基础的业务来说,ASR 降价 95% 之后,识别环节的开销只剩零头,中小开发者接入语音能力的成本门槛也随之降低。
小结
Qwen-Audio-3.1 系列各模型的详细规格与最新定价以官方页面为准,IT之家已整理官方介绍全文,需要逐项核对的读者可参阅:千问发布 Qwen-Audio-3.1 系列语音大模型。



