神经机器翻译持续训练中的灾难性遗忘研究
计算与语言
2020-12-01 v3 人工智能
摘要
神经机器翻译(NMT)模型在持续训练中通常遭受灾难性遗忘,即模型倾向于逐渐遗忘已学知识并偏向拟合新加入的、可能具有不同分布(如不同领域)的数据。尽管已提出许多方法解决该问题,我们仍不清楚其成因。在领域自适应背景下,我们从模块与参数(神经元)视角探究灾难性遗忘的成因。对NMT模型模块的调查表明,部分模块与通用领域知识紧密关联,而另一些模块在领域自适应中更为关键。对参数的调查表明,部分参数对通用领域与领域内翻译均重要,持续训练中它们的剧烈变化导致通用领域性能下降。我们在不同语言对与领域上实验,以确保发现的效度与可靠性。
引用
@article{arxiv.2011.00678,
title = {Investigating Catastrophic Forgetting During Continual Training for Neural Machine Translation},
author = {Shuhao Gu and Yang Feng},
journal= {arXiv preprint arXiv:2011.00678},
year = {2020}
}
备注
Coling2020 long paper