中文

非自回归序列生成模型研究

计算与语言 2020-05-12 v2 机器学习 声音 音频与语音处理

摘要

非自回归(NAR)模型并行生成序列的所有词元,相较于自回归(AR)模型生成速度更快,但代价是准确率较低。包括知识蒸馏和源-目标对齐在内的不同技术已被提出,以缩小 AR 与 NAR 模型在神经机器翻译(NMT)、自动语音识别(ASR)和文本到语音(TTS)等多种任务间的差距。借助这些技术,NAR 模型在部分任务中可赶上 AR 模型的准确率,但在其他一些任务中则不能。本工作中,我们开展一项研究以理解 NAR 序列生成的困难,并尝试回答:(1)为何 NAR 模型在部分任务中能赶上 AR 模型而非全部?(2)为何知识蒸馏和源-目标对齐等技术能帮助 NAR 模型。由于 AR 与 NAR 模型的主要区别在于 NAR 模型不使用目标词元间的依赖而 AR 模型使用,直观上 NAR 序列生成的困难严重依赖于目标词元间依赖的强弱。为量化此种依赖,我们提出一种称为 CoMMA 的分析模型来刻画不同 NAR 序列生成任务的困难。我们有若干有趣发现:1)在 NMT、ASR 和 TTS 任务中,ASR 的目标词元依赖最强,而 TTS 最弱。2)知识蒸馏降低了目标序列中的目标词元依赖,从而提升 NAR 模型的准确率。3)源-目标对齐约束鼓励目标词元对源词元的依赖,从而缓解 NAR 模型的训练。

关键词

引用

@article{arxiv.2004.10454,
  title  = {A Study of Non-autoregressive Model for Sequence Generation},
  author = {Yi Ren and Jinglin Liu and Xu Tan and Zhou Zhao and Sheng Zhao and Tie-Yan Liu},
  journal= {arXiv preprint arXiv:2004.10454},
  year   = {2020}
}

备注

Accepted by ACL 2020