中文

集成CTC、注意力与换能器解码器的联合束搜索

音频与语音处理 2025-01-15 v2 计算与语言 声音

摘要

端到端自动语音识别(E2E-ASR)可根据其解码器架构进行分类,例如连接时序分类(CTC)、循环神经网络换能器(RNN-T)、基于注意力的编码器-解码器和Mask-CTC模型。每种解码器架构都有优缺点,导致从业者根据应用需求在这些不同模型之间切换。我们不构建单独的模型,而是提出了一种联合建模方案,其中四个解码器(CTC、RNN-T、注意力和Mask-CTC)共享同一个编码器——我们称之为4D建模。4D模型联合训练,这将带来模型正则化,并由于其互补特性最大化模型鲁棒性。为了高效训练4D模型,我们引入了一种两阶段训练策略,稳定了联合训练。此外,我们提出了三种新颖的联合束搜索算法,通过结合三个解码器(CTC、RNN-T和注意力)来进一步提高性能。这三种束搜索算法在哪个解码器用作主解码器上有所不同。我们仔细评估了每种算法的性能和计算权衡。实验结果表明,联合训练的4D模型优于仅使用单个解码器训练的E2E-ASR模型。此外,我们证明了所提出的联合束搜索算法优于先前提出的CTC/注意力解码。

关键词

引用

@article{arxiv.2406.02950,
  title  = {Joint Beam Search Integrating CTC, Attention, and Transducer Decoders},
  author = {Yui Sudo and Muhammad Shakeel and Yosuke Fukumoto and Brian Yan and Jiatong Shi and Yifan Peng and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2406.02950},
  year   = {2025}
}

备注

accepted to IEEE/ACM Transactions on Audio Speech and Language Processing