中文

基于非自回归 Transformer 的序列到序列模型端到端集成训练

计算与语言 2021-09-28 v1

摘要

语音翻译或枢轴翻译等复杂自然语言应用传统上依赖级联模型。然而,级联模型已知容易出现错误传播与模型失配问题。此外,传统级联系统无法使用端到端训练数据,意味着最适合该任务的数据无法被利用。先前研究提出了若干集成端到端训练的方法以克服这些问题,但它们大多依赖(合成或自然的)三元数据。我们提出了一种基于非自回归 Transformer 的级联模型,可在无需显式中间表示的情况下实现端到端训练。这一新架构(i)避免了可能导致错误并在级联模型中传播的过早决策,且(ii)直接利用端到端训练数据。我们在两个基于枢轴的机器翻译任务(即法语-德语与德语-捷克语)上进行了评估。实验结果表明,相较于级联基线,所提架构在法语-德语上取得了超过 2 BLEU 的提升。

关键词

引用

@article{arxiv.2109.12950,
  title  = {Integrated Training for Sequence-to-Sequence Models Using Non-Autoregressive Transformer},
  author = {Evgeniia Tokarchuk and Jan Rosendahl and Weiyue Wang and Pavel Petrushkov and Tomer Lancewicki and Shahram Khadivi and Hermann Ney},
  journal= {arXiv preprint arXiv:2109.12950},
  year   = {2021}
}

备注

IWSLT 2021 camera-ready