中文

面向语音到文本生成的非自回归建模比较研究

音频与语音处理 2021-10-12 v1 计算与语言 声音

摘要

非自回归(NAR)模型同时生成序列中的多个输出,与自回归基线相比,它以精度下降为代价显著降低了推理速度。展现出对实时应用的巨大潜力,越来越多的 NAR 模型在不同领域被探索以缓解与 AR 模型之间的性能差距。本工作中,我们对多种用于端到端自动语音识别(ASR)的 NAR 建模方法进行了比较研究。实验在使用 ESPnet 的最先进设置下完成。各项任务上的结果为了解 NAR ASR 提供了有趣的发现,例如精度-速度权衡以及对长语音的鲁棒性。我们还展示了这些技术可组合以进一步改进,并可应用于 NAR 端到端语音翻译。所有实现均已公开以促进 NAR 语音处理的进一步研究。

关键词

引用

@article{arxiv.2110.05249,
  title  = {A Comparative Study on Non-Autoregressive Modelings for Speech-to-Text Generation},
  author = {Yosuke Higuchi and Nanxin Chen and Yuya Fujita and Hirofumi Inaguma and Tatsuya Komatsu and Jaesong Lee and Jumon Nozaki and Tianzi Wang and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2110.05249},
  year   = {2021}
}

备注

Accepted to ASRU2021