中文

重新审视强化学习用于神经机器翻译的弱点

计算与语言 2021-06-17 v1

摘要

策略梯度算法在自然语言处理中得到广泛采用,但近来受到批评,令人怀疑其是否适用于神经机器翻译(NMT)。Choshen 等人(2020)指出了多处弱点,并怀疑其成功由输出分布的形状而非奖励所决定。本文中,我们重新审视这些论断,并在更广泛的配置下对其研究。我们在域内与跨域自适应上的实验揭示了探索与奖励缩放的重要性,并为这些论断提供了经验反证。

关键词

引用

@article{arxiv.2106.08942,
  title  = {Revisiting the Weaknesses of Reinforcement Learning for Neural Machine Translation},
  author = {Samuel Kiegeland and Julia Kreutzer},
  journal= {arXiv preprint arXiv:2106.08942},
  year   = {2021}
}