中文

FireRedASR:面向工业级普通话语音识别的开源模型从编码器-解码器到LLM集成

音频与语音处理 2025-01-27 v1 声音

摘要

我们提出FireRedASR,一套大规模自动语音识别(ASR)模型,用于普通话,旨在满足不同应用中卓越性能和 optimal efficiency 的需求。FireRedASR包含两个变体:FireRedASR-LLM:旨在实现最先进(SOTA)性能并实现无缝的端到端语音交互。它采用Encoder-Adapter-LLM框架,利用大语言模型(LLM)的能力。 在公开的普通话基准测试上,FireRedASR-LLM(83亿参数)实现平均字符错误率(CER)为3.05%,超过最新的SOTA 3.33%,实现8.4%的相对CER减小(CERR)。它在工业级基线模型上表现出优异的泛化能力,在多源普通话ASR场景(如视频、直播、智能助理)中实现24%-40%的CERR。FireRedASR-AED:旨在在高性能和计算效率之间取得平衡,作为基于LLM的语音模型中的有效语音表示模块。它采用基于注意力的编码器-解码器(AED)架构。在公开的普通话基准测试上,FireRedASR-AED(11亿参数)实现平均CER为3.18%,略低于FireRedASR-LLM,但仍超过最新的拥有120亿以上参数的模型。它采用更紧凑的规模,适用于资源受限的应用。此外,两个模型在中文方言和英文语音基准测试中均表现出竞争力,在歌词识别方面也表现出色。为推动语音处理领域的研究,我们在https://github.com/FireRedTeam/FireRedASR发布了我们的模型和推理代码。

关键词

引用

@article{arxiv.2501.14350,
  title  = {FireRedASR: Open-Source Industrial-Grade Mandarin Speech Recognition Models from Encoder-Decoder to LLM Integration},
  author = {Kai-Tuo Xu and Feng-Long Xie and Xu Tang and Yao Hu},
  journal= {arXiv preprint arXiv:2501.14350},
  year   = {2025}
}