中文

用于端到端自动语音识别的基于插入的建模

音频与语音处理 2020-11-17 v2 声音

摘要

端到端(E2E)模型在自动语音识别(ASR)研究领域受到关注。迄今提出的许多 E2E 模型均假设输出词元序列的自左向右自回归生成,连接主义时序分类(CTC)及其变体除外。然而,自左向右解码无法考虑未来输出上下文,且对 ASR 并非总是最优。非自左向右模型之一为非自回归 Transformer(NAT),已在神经机器翻译(NMT)研究中被深入探究。一种 NAT 模型 mask-predict 已被应用于 ASR,但该模型需要某些启发式方法或附加组件来估计输出词元序列的长度。本文提出将另一类最初为 NMT 提出的 NAT——基于插入的模型——应用于 ASR 任务。基于插入的模型解决了上述 mask-predict 问题,并能生成任意的输出序列生成顺序。此外,我们引入基于插入的模型与 CTC 联合训练的新公式。该公式以使 CTC 依赖于基于插入的非自回归词元生成的方式强化 CTC。我们在三个公开基准上实验,取得了与强自回归 Transformer 在相似解码条件下相竞争的性能。

关键词

引用

@article{arxiv.2005.13211,
  title  = {Insertion-Based Modeling for End-to-End Automatic Speech Recognition},
  author = {Yuya Fujita and Shinji Watanabe and Motoi Omachi and Xuankai Chan},
  journal= {arXiv preprint arXiv:2005.13211},
  year   = {2020}
}

备注

INTERSPEECH 2020