中文

针对流式 ASR 的 LF-MMI、CTC 与 RNN-T 准则基准评测

音频与语音处理 2020-11-11 v1 声音

摘要

在本工作中,为衡量延迟可控的流式自动语音识别(ASR)应用的准确率与效率,我们对三种流行的训练准则进行了全面评估:LF-MMI、CTC 和 RNN-T。在转写训练数据为 3K–14K 小时的 7 种语言的社交媒体视频时,我们使用相同的数据集和编码器模型架构,跨每种准则进行了大规模受控实验。我们发现 RNN-T 在 ASR 准确率上具有一致优势,而 CTC 模型在推理效率上表现突出。此外,我们选择性地考察了针对不同训练准则的多种建模策略,包括建模单元、编码器架构、预训练等。鉴于此类大规模真实世界流式 ASR 应用,据我们所知,我们首次对这些广泛使用的训练准则在多种语言上给出了全面基准。

关键词

引用

@article{arxiv.2011.04785,
  title  = {Benchmarking LF-MMI, CTC and RNN-T Criteria for Streaming ASR},
  author = {Xiaohui Zhang and Frank Zhang and Chunxi Liu and Kjell Schubert and Julian Chan and Pradyot Prakash and Jun Liu and Ching-Feng Yeh and Fuchun Peng and Yatharth Saraf and Geoffrey Zweig},
  journal= {arXiv preprint arXiv:2011.04785},
  year   = {2020}
}

备注

Accepted for publication at IEEE Spoken Language Technology Workshop (SLT), 2021