中文

Mask CTC:基于 CTC 与掩码预测的非自回归端到端 ASR

音频与语音处理 2020-08-18 v2 声音

摘要

我们提出 Mask CTC,一种新颖的非自回归端到端自动语音识别(ASR)框架,它通过精炼连接主义时序分类(CTC)的输出生成序列。神经序列到序列模型通常是自回归的:每个输出词元通过以先前生成的词元为条件来生成,代价是需要与输出长度相同次数的迭代。另一方面,非自回归模型能在常数次迭代内同时生成词元,从而显著减少推理时间,并更适用于现实场景下的端到端 ASR 模型。在本工作中,Mask CTC 模型使用 Transformer 编码器-解码器进行训练,并对掩码预测与 CTC 进行联合训练。在推理阶段,目标序列由贪婪 CTC 输出初始化,并基于 CTC 概率对低置信度词元进行掩码。基于输出词元间的条件依赖关系,这些被掩码的低置信度词元随后以高置信度词元为条件进行预测。在不同语音识别任务上的实验结果表明,Mask CTC 优于标准 CTC 模型(例如 WSJ 上 WER 从 17.9% 降至 12.1%),并接近自回归模型,且在 CPU 上仅需极少推理时间(Python 实现中 RTF 为 0.07)。我们的所有代码将公开可用。

关键词

引用

@article{arxiv.2005.08700,
  title  = {Mask CTC: Non-Autoregressive End-to-End ASR with CTC and Mask Predict},
  author = {Yosuke Higuchi and Shinji Watanabe and Nanxin Chen and Tetsuji Ogawa and Tetsunori Kobayashi},
  journal= {arXiv preprint arXiv:2005.08700},
  year   = {2020}
}

备注

Accepted to INTERSPEECH2020