中文

All-in-One ASR:在双模式 ASR 中统一 CTC、注意力与 Transducer 的编码器-解码器模型

音频与语音处理 2025-12-15 v1

摘要

本文提出了一个统一框架 All-in-One ASR,允许单个模型支持多种自动语音识别(ASR)范式,包括连接时序分类(CTC)、基于注意力的编码器-解码器(AED)和 Transducer,并同时支持离线与流式模式。尽管每种 ASR 架构根据应用场景提供不同的优势和权衡,但为每种场景维护独立的模型会产生大量的开发和部署成本。为了解决这个问题,我们引入了一个多模式联合器,能够在单个统一模型内无缝集成各种 ASR 模式。实验表明,All-in-One ASR 显著减少了总模型占用空间,同时匹配甚至超越了单独优化的 ASR 模型的识别性能。此外,联合解码利用了不同 ASR 模式的互补优势,带来了识别准确率的进一步提升。

关键词

引用

@article{arxiv.2512.11543,
  title  = {All-in-One ASR: Unifying Encoder-Decoder Models of CTC, Attention, and Transducer in Dual-Mode ASR},
  author = {Takafumi Moriya and Masato Mimura and Tomohiro Tanaka and Hiroshi Sato and Ryo Masumura and Atsunori Ogawa},
  journal= {arXiv preprint arXiv:2512.11543},
  year   = {2025}
}

备注

Accepted to ASRU 2025