中文

无向序列模型的生成顺序学习与分析

计算与语言 2021-12-17 v1 人工智能 机器学习

摘要

在机器翻译任务中,无向神经序列模型已取得与从左至右单调生成的最先进有向序列模型相当的竞争力。在本工作中,我们通过强化学习训练了一个策略,为预训练的无向翻译模型学习生成顺序。我们表明,在 WMT'14 德语-英语翻译任务上,由我们学习到的顺序解码出的翻译获得了比从左至右解码或由 Mansimov 等人 (2019) 学习到的顺序解码更高的 BLEU 分数。在 De-En、WMT'16 英语-罗马尼亚语和 WMT'21 英语-汉语翻译任务中源和目标最大长度为 30 的样本上,我们学习到的顺序在六个任务中的四个上优于所有启发式生成顺序。接下来,我们通过定性和定量分析仔细研究了学习到的顺序模式。我们表明,我们的策略通常遵循从外到内的顺序,首先预测最左和最右位置,然后向中间移动,同时在一开始跳过不太重要的词。此外,该策略通常在连续步骤中预测单一句法成分结构的位置。我们相信,我们的发现可以为无向生成模型的机制提供更多见解,并鼓励该方向的进一步研究。我们的代码已在 https://github.com/jiangycTarheel/undirected-generation 公开。

关键词

引用

@article{arxiv.2112.09097,
  title  = {Learning and Analyzing Generation Order for Undirected Sequence Models},
  author = {Yichen Jiang and Mohit Bansal},
  journal= {arXiv preprint arXiv:2112.09097},
  year   = {2021}
}

备注

EMNLP 2021 Findings (12 pages)