面向基于编辑的非自回归神经机器翻译的强化学习
计算与语言
2024-07-03 v2
摘要
非自回归(NAR)语言模型以其在神经机器翻译(NMT)中的低延迟而闻名。然而,由于解码空间巨大且难以准确捕捉目标词之间的依赖关系,NAR 与自回归模型之间存在性能差距。更糟糕的是,为 NAR 模型准备合适的训练数据是一项艰巨的任务,往往会加剧暴露偏差。为了应对这些挑战,我们将强化学习(RL)应用于 Levenshtein Transformer(一种代表性的基于编辑的 NAR 模型),证明了使用自生成数据的 RL 可以增强基于编辑的 NAR 模型的性能。我们探索了两种 RL 方法:逐步奖励最大化和回合奖励最大化。我们讨论了这两种方法的优缺点并进行了实证验证。此外,我们通过实验研究了温度设置对性能的影响,证实了正确的温度设置对于 NAR 模型训练的重要性。
引用
@article{arxiv.2405.01280,
title = {Reinforcement Learning for Edit-Based Non-Autoregressive Neural Machine Translation},
author = {Hao Wang and Tetsuro Morimura and Ukyo Honda and Daisuke Kawahara},
journal= {arXiv preprint arXiv:2405.01280},
year = {2024}
}
备注
NAACL SRW 2024