中文

面向机器翻译的注意力强制方法

计算与语言 2021-04-06 v1 人工智能 机器学习

摘要

具有注意力机制的自回归序列到序列模型在包括文本到语音(TTS)与神经机器翻译(NMT)在内的多项任务中取得了最先进的性能。标准训练方法教师强制(teacher forcing)以参考输出历史引导模型。在推理阶段,则必须使用生成的输出历史。这一不匹配会影响性能。然而,利用生成的输出训练模型极具挑战。已有若干方法试图解决该问题,通常选择性地使用生成的输出历史。为使训练稳定,这些方法往往需要启发式调度或辅助分类器。本文为NMT引入注意力强制(attention forcing)。该方法以生成的输出历史与参考注意力引导模型,无需调度或分类器即可减小训练-推理不匹配。注意力强制在TTS中已获成功,但因其输出空间的离散与多模态特性,应用于NMT更具挑战。为应对此问题,本文在原始注意力强制中加入选择机制,自动为每对训练数据选取合适的训练方式。实验表明,注意力强制可提升整体翻译质量与译文的多样性。

关键词

引用

@article{arxiv.2104.01264,
  title  = {Attention Forcing for Machine Translation},
  author = {Qingyun Dou and Yiting Lu and Potsawee Manakul and Xixin Wu and Mark J. F. Gales},
  journal= {arXiv preprint arXiv:2104.01264},
  year   = {2021}
}

备注

arXiv admin note: text overlap with arXiv:1909.12289