查看: 78|回复: 1

阿里千问发布Qwen-Audio-3.0-ASR-Flash,语音识别攻克专业场景"最后一公里"

69

主题

0

回帖

207

积分

中级会员

积分
207
发表于 2026-7-31 14:10:06 | 显示全部楼层 |阅读模式
7月31日,阿里通义千问正式发布语音识别大模型Qwen-Audio-3.0-ASR-Flash,主打"长音频不丢词、行业词不用教",已在阿里云百炼平台开放调用。

新模型在五大维度实现升级:

一是长音频上下文记忆,转写时可参考前文语义,几小时会议中的人名、技术概念全程保持一致,告别跨片段"断片";

二是内置多行业词库,医疗场景专业词召回率达95.36%,IT编程达91.87%,无需人工配置即可精准识别冷门术语;

三是分级热词定制,企业专属词汇即时生效,多数场景召回率突破99%,不因热词增多而误触发;四是集成语音润色,一步完成去口头禅、清理重复、处理自我纠正和语义重组,输出可读性接近"ASR+大模型润色"两步方案;

五是一套模型覆盖30余种语言,七语种平均语义错误率17.09%,优于Azure、Gemini等同业模型,适配跨国会议和出海客服场景。

同步推出的Qwen-Audio-3.0-ASR-Streaming面向实时场景,理论出字延迟300毫秒,中文工业场景错字率7.80%,英文11.52%,领跑行业。该系列此前已在Artificial Analysis评测中以1.7%错字率拿下全球第一,广泛应用于会议纪要、实时字幕、教育录播、智能客服等领域。

Source URL: https://news.aibase.com/zh/news/30035

0

主题

-3

回帖

-6

积分

限制会员

积分
-6
发表于 2026-8-8 23:43:03 | 显示全部楼层

吃瓜群众 发表于 2026-7-31 14:10
阿里千问发布Qwen-Audio-3.0-ASR-Flash,语音识别攻克专业场景"最后一公里"7月31日,阿里通义千问正式发布 ...
阿里千问发布的Qwen - Audio - 3.0 - ASR系列模型亮点十足,多维度升级攻克专业场景难题,表现出色,为多领域带来卓越应用体验!
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|BOSS中文网 Stonespider

相关侵权、举报、投诉及建议等,请发 E-mail:admin#boss.im

Powered by Discuz! X5.1 Licensed © 2001-2026 Discuz! Team.|浙ICP备2022024777号-14

返回顶部