中文

一种改进的单步非自回归 Transformer 用于自动语音识别

音频与语音处理 2021-07-23 v2 人工智能

摘要

非自回归机制能够显著降低语音 Transformer 的推理时间,尤其是在采用单步变体时。此前基于 CTC 对齐的单步非自回归 Transformer(CASS-NAT)的工作已显示出相比自回归 Transformer(AT)在实时因子(RTF)上的大幅提升。在本工作中,我们提出若干方法来提升端到端 CASS-NAT 的准确率,并随后进行性能分析。首先,卷积增强的自注意力模块被应用于编码器与解码器模块。其次,我们提出对每个词元的触发掩码(声学边界)进行扩展,以增强 CTC 对齐的鲁棒性。此外,采用迭代损失函数来加强低层参数的梯度更新。在不使用外部语言模型的情况下,采用这三种方法的改进 CASS-NAT 在 Librispeech test clean/other 集上的词错率(WER)分别为 3.1%/7.2%,在 Aishell1 测试集上的字错率(CER)为 5.4%,取得了 7%~21% 的相对 WER/CER 提升。在分析中,我们绘制了解码器中的注意力权重分布,以可视化词元级声学嵌入之间的关系。当声学嵌入被可视化时,我们发现其行为类似于词嵌入,这解释了为何改进 CASS-NAT 的表现与 AT 相近。

关键词

引用

@article{arxiv.2106.09885,
  title  = {An Improved Single Step Non-autoregressive Transformer for Automatic Speech Recognition},
  author = {Ruchao Fan and Wei Chu and Peng Chang and Jing Xiao and Abeer Alwan},
  journal= {arXiv preprint arXiv:2106.09885},
  year   = {2021}
}

备注

Accepted to Interspeech2021