中文

推进非自回归语音识别的极限

音频与语音处理 2021-09-14 v4 计算与语言 机器学习 声音

摘要

我们将端到端语音识别的最新进展结合到非自回归自动语音识别中。我们推进了多个数据集上非自回归最先进结果的极限:LibriSpeech、Fisher+Switchboard和Wall Street Journal。我们方法的关键在于,我们在巨型Conformer神经网络架构上利用CTC,并结合SpecAugment和wav2vec2预训练。我们在LibriSpeech test/test-other集上取得1.8%/3.6%的WER,在Switchboard上取得5.1%/9.8%的WER,在Wall Street Journal上取得3.4%的WER,且均无需语言模型。

关键词

引用

@article{arxiv.2104.03416,
  title  = {Pushing the Limits of Non-Autoregressive Speech Recognition},
  author = {Edwin G. Ng and Chung-Cheng Chiu and Yu Zhang and William Chan},
  journal= {arXiv preprint arXiv:2104.03416},
  year   = {2021}
}

备注

Proceedings of INTERSPEECH