基于解码步的调度采样用于神经机器翻译
计算与语言
2021-09-01 v2
摘要
调度采样被广泛用于缓解神经机器翻译中的曝光偏差问题。其核心动机是通过用预测词替换真实词来在训练中模拟推理场景,从而弥合训练与推理间的差距。然而,原始的调度采样仅基于训练步且平等对待所有解码步。即,它模拟了具有均匀错误率的推理场景,这违背了真实推理场景——由于错误累积,较大的解码步通常具有更高的错误率。为缓解上述差异,我们提出基于解码步的调度采样方法,随解码步增大而增加预测词被选中的概率。从而,我们能在训练中更真实地模拟推理场景,更好地弥合训练与推理间的差距。此外,我们探究了基于训练步与解码步结合的调度采样以进一步提升效果。实验上,我们的方法在三个大规模WMT任务上显著优于Transformer基线与原版调度采样。并且,我们的方法在两个流行基准的文本摘要任务上也泛化良好。
引用
@article{arxiv.2108.12963,
title = {Scheduled Sampling Based on Decoding Steps for Neural Machine Translation},
author = {Yijin Liu and Fandong Meng and Yufeng Chen and Jinan Xu and Jie Zhou},
journal= {arXiv preprint arXiv:2108.12963},
year = {2021}
}
备注
Code is at https://github.com/Adaxry/ss_on_decoding_steps. To appear in EMNLP-2021 main conference. arXiv admin note: text overlap with arXiv:2107.10427