在低遗忘风险区域内进行神经机器翻译的持续学习
计算与语言
2022-11-07 v2
摘要
本文研究在不访问先前训练数据或引入模型分离的情况下,大规模预训练神经机器翻译模型的持续学习。我们认为广泛使用的基于正则化的方法通过辅助损失进行多目标学习,存在错误估计问题,且无法始终在先前任务与新任务间取得良好平衡。为解决该问题,我们提出一种基于真实损失局部特征的二阶段训练方法。我们首先搜索低遗忘风险区域,即参数更新时模型能保持先前任务性能的区域,以避免灾难性遗忘问题。然后我们可仅使用该区域内的新训练数据对模型持续训练以拟合新任务。具体而言,我们提出两种搜索低遗忘风险区域的方法,分别基于损失的曲率以及参数对模型输出的影响。我们在领域自适应和更具挑战性的语言自适应任务上开展实验,实验结果表明相较若干强基线我们的方法能取得显著改进。
引用
@article{arxiv.2211.01542,
title = {Continual Learning of Neural Machine Translation within Low Forgetting Risk Regions},
author = {Shuhao Gu and Bojie Hu and Yang Feng},
journal= {arXiv preprint arXiv:2211.01542},
year = {2022}
}
备注
EMNLP 2022 Main Conference Long Paper