
7 月 6 日,阿里升级语音实时识别大模型 Fun-ASR-Realtime。作为一款流式模型,其识别准确率接近离线模型,首字延迟在百毫秒级别,长句尾字延迟低,支持 16 种方言和 30 种语言。在 7 月 2 日结束的影视飓风“重返荒岛”100 小时直播节目中,实时字幕由 Fun-ASR-Realtime 全程提供支持,共识别出六万多条字幕,132 万字。
语音识别模型分为离线和实时两类,离线模型可一次性输入录好的音频,准确度更高;实时模型边录边识,需又准又快,识别难度更高,适合直播字幕、会议实时转写、客服通话等低延迟场景。
全新升级的 Fun-ASR-Realtime 兼具速度和精度。在速度上,模型首字时延控制在百毫秒级别,话音刚落,文字即开始呈现,对于很长的句子,尾字输出的延迟也很低。以“重返荒岛”100 小时直播为例,多人两岛互动、说话人频繁切换,赛制复杂还遇上了暴雨,观众可即时看到 Tim 和中国 boy 等嘉宾的发言字幕,增强了观看体验。
在准确率上,Fun-ASR-Realtime 接近其离线模型 Fun-ASR-Flash,面向泛 Context(包含历史对话上下文和实时热词)进行了专项强化,具备上下文理解能力。例如直播节目中 Tim 说出的“夜鹭”最初被误识为“叶鹿”,通过上下文补充“观鸟的朋友应该知道”后,立刻纠正。

相较于市面上的实时模型,Fun-ASR-Realtime 支持的语音种类更加丰富,可识别出 16 种方言和 30 种语言。在八大方言区的 16 种方言识别测评中,Fun-ASR-Realtime 的字符准确率平均为 88.62%,在 12 类方言中领先,超越火山与腾讯相关产品。其中,在高难度的吴语系方言表现尤为惊艳:上海话和苏州话的字符准确率分别为 92.41% 和 89.21%,号称“最难懂方言”的温州话,准确率为 82.74%。与此同时,模型在福建话、客家话等复杂方言上也全面领先。

在 5 类工业中文和英文场景的语音识别测评中,针对复杂背景、远场嘈杂以及各种带口音的场景,Fun-ASR-Realtime 依然表现良好,平均字符准确率分别为 88.42%、91.58%,领先相关产品。

模型面向泰语等东亚、东南亚多语言场景进行了专项优化,识别准确率提升了 20%,适用于出海客服、国际会议等场景。
Fun-ASR-Realtime 的离线模式模型 Fun-ASR-Flash 也已于近期上线。在全球权威 AI 评测平台 Artificial Analysis,Fun-ASR-Flash(榜单上为该模型曾用名“Fun-realtime-ASR-preview”)错字率 1.7%,位列全球第一。

两款模型均已上线阿里云百炼。
Fun-ASR-Realtime:
https://help.aliyun.com/zh/model-studio/real-time-speech-recognition-user-guide
Fun-ASR-Flash:
https://bailian.console.aliyun.com/cn-beijing#/doc/?type=model&url=2979031
广告声明:文内含有的对外跳转链接(包括不限于超链接、二维码、口令等形式),用于传递更多信息,节省甄选时间,结果仅供参考,IT之家包含外链的文章均包含本声明。