面向神经机器翻译的梯度引导损失掩码
计算与语言
2021-03-01 v1
摘要
为减轻低质量训练数据对神经机器翻译模型性能的负面影响,多数现有策略聚焦于在训练开始前过滤掉有害数据。本文中,我们探索在训练过程中利用模型在一小部分干净数据上的梯度动态优化数据使用的策略。在每个训练步,我们的算法计算训练数据与干净数据间的梯度对齐,以掩码掉具有负对齐的数据。我们的方法具有直观直觉:好的训练数据应以与干净数据相似的方向更新模型参数。在三个 WMT 语言对上的实验表明,我们的方法相较强基线带来显著提升,且改进可泛化至不同领域的测试数据。
引用
@article{arxiv.2102.13549,
title = {Gradient-guided Loss Masking for Neural Machine Translation},
author = {Xinyi Wang and Ankur Bapna and Melvin Johnson and Orhan Firat},
journal= {arXiv preprint arXiv:2102.13549},
year = {2021}
}