4D ASR:CTC、注意力、转导器与掩码预测解码器的联合建模
声音
2023-05-31 v2 计算与语言
音频与语音处理
摘要
端到端(E2E)自动语音识别(ASR)的网络架构可分为若干模型,包括连接主义时序分类(CTC)、循环神经网络转导器(RNN-T)、注意力机制和非自回归掩码预测模型。由于每种网络架构各有优劣,典型用例是根据应用需求切换这些独立模型,导致维护所有模型的额外开销。已有一些集成其中两种互补模型以缓解开销问题的方法被提出;然而,若集成更多模型,我们将进一步受益于这些互补模型,并以单一系统实现更广泛的应用。本文提出 CTC、注意力、RNN-T 和掩码预测的四解码器联合建模(4D),具有以下三点优势:1)四个解码器联合训练,可根据应用场景轻松切换。2)得益于其互补特性,联合训练可带来模型正则化并提升模型鲁棒性。3)使用 CTC、注意力和 RNN-T 的新型单遍联合解码方法进一步提升了性能。实验结果表明,所提模型一致地降低了词错率(WER)。
引用
@article{arxiv.2212.10818,
title = {4D ASR: Joint modeling of CTC, Attention, Transducer, and Mask-Predict decoders},
author = {Yui Sudo and Muhammad Shakeel and Brian Yan and Jiatong Shi and Shinji Watanabe},
journal= {arXiv preprint arXiv:2212.10818},
year = {2023}
}
备注
Accepted by INTERRSPEECH2023