中文

用于机器翻译的并行注意力强制

计算与语言 2022-11-08 v1

摘要

基于注意力的自回归模型在各种序列到序列任务中取得了最先进的性能,包括文本到语音(TTS)和神经机器翻译(NMT),但可能难以训练。标准的训练方法教师强制以参考回看历史引导模型。在推理时,必须使用生成的回看历史。这种不匹配限制了评估性能。注意力强制已被引入以解决该不匹配,以生成的回看历史和参考注意力引导模型。虽然在 TTS 等具有连续输出的任务中成功,注意力强制在 NMT 等具有离散输出的任务中面临额外挑战。本文介绍了注意力强制的两个扩展以应对这些挑战。(1)调度注意力强制自动开启和关闭注意力强制,这对于具有离散输出的任务至关重要。(2)并行注意力强制使训练并行化,并适用于基于 Transformer 的模型。实验表明所提方法提升了基于 RNN 和 Transformer 的模型的性能。

关键词

引用

@article{arxiv.2211.03237,
  title  = {Parallel Attention Forcing for Machine Translation},
  author = {Qingyun Dou and Mark Gales},
  journal= {arXiv preprint arXiv:2211.03237},
  year   = {2022}
}

备注

13 pages, 8 figures. arXiv admin note: text overlap with arXiv:2104.01264