中文

FireRedASR2S:面向工业级的全能自动语音识别系统

音频与语音处理 2026-03-12 v1 声音

摘要

我们 presented FireRedASR2S,一个工业级全能自动语音识别 (ASR) 系统。它集成了四个模块于统一的管道中:ASR、语音活动检测 (VAD)、说话语言识别 (LID) 和标点预测 (Punc)。所有模块在评估基准测试中均实现了 SOTA 水平:FireRedASR2:一个具有两个变体的 ASR 模块,FireRedASR2-LLM(80 亿+ 参数)和 FireRedASR2-AED(10 亿+ 参数),支持普通话、中文方言和口音、英文以及代码混合。与 FireRedASR 相比,FireRedASR2 在识别准确率和方言、口音覆盖范围方面均取得了改进。FireRedASR2-LLM 在 4 个公开普通话基准测试上实现 2.89% 的平均字错率,在 19 个公开中文方言和口音基准测试上实现 11.55%,超越了包括豆包-ASR、Qwen3-ASR 和 Fun-ASR 在内的竞争基准。FireRedVAD:一个基于深度前馈顺序记忆网络 (DFSMN) 的超轻量模块(0.6 百万参数),支持流式 VAD、非流式 VAD 和多标签 VAD (mVAD)。在 FLEURS-VAD-102 基准测试上,它实现了 97.57% 的帧级 F1 和 99.60% 的 AUC-ROC,超越了 Silero-VAD、TEN-VAD、FunASR-VAD 和 WebRTC-VAD。FireRedLID:一个支持 100+ 语言和 20+ 中文方言和口音的编码器-解码器 LID 模块。在 FLEURS(82 种语言)上实现了 97.18% 的 utterance 级别准确率,超越了 Whisper 和 SpeechBrain。FireRedPunc:一个用于中文和英文的 BERT 风格标点预测模块。在多域基准测试上实现 78.90% 的平均 F1,超越了 FunASR-Punc(62.77%)。为推动语音处理领域的研究,我们在 https://github.com/FireRedTeam/FireRedASR2S 上发布了模型权重和代码。

关键词

引用

@article{arxiv.2603.10420,
  title  = {FireRedASR2S: A State-of-the-Art Industrial-Grade All-in-One Automatic Speech Recognition System},
  author = {Kaituo Xu and Yan Jia and Kai Huang and Junjie Chen and Wenpeng Li and Kun Liu and Feng-Long Xie and Xu Tang and Yao Hu},
  journal= {arXiv preprint arXiv:2603.10420},
  year   = {2026}
}