中文

Align-Refine:基于迭代重对齐的非自回归语音识别

音频与语音处理 2020-10-28 v1 计算与语言 机器学习 声音

摘要

非自回归模型相比典型的序列到序列模型大幅提升了解码速度,但性能有所下降。填充和迭代精炼模型通过对非自回归模型的输出进行编辑,弥补了部分差距,但其可进行的编辑受到限制。我们提出迭代重对齐,其中精炼发生在潜对齐空间而非输出序列空间。我们在语音识别中展示了这一点,提出 Align-Refine,一种端到端的基于 Transformer 的模型,其精炼连接主义时序分类(CTC)对齐以允许改变长度的插入和删除。Align-Refine 优于 Imputer 和 Mask-CTC,在 WSJ 上以 1/14 的实时因子匹配自回归基线,并在无语言模型的情况下达到 LibriSpeech test-other 词错率 9.0%。我们的模型即使在一次迭代和使用较浅解码器时也表现强劲。

关键词

引用

@article{arxiv.2010.14233,
  title  = {Align-Refine: Non-Autoregressive Speech Recognition via Iterative Realignment},
  author = {Ethan A. Chi and Julian Salazar and Katrin Kirchhoff},
  journal= {arXiv preprint arXiv:2010.14233},
  year   = {2020}
}