二次正则化如何防止灾难性遗忘:插值的作用
机器学习
2022-08-16 v5
摘要
灾难性遗忘削弱了深度神经网络(DNNs)在持续学习和终身学习等场景下的有效性。尽管已有若干方法被提出以应对该问题,但解释这些方法为何有效的研究十分有限。本文旨在更好地解释一种广泛使用的避免灾难性遗忘的技术:二次正则化。我们表明,二次正则化通过在每次训练迭代中对模型参数的当前值与先前值进行插值来防止对过去任务的遗忘。在多次训练迭代中,该插值操作降低了更重要模型参数的学习率,从而将其移动最小化。我们的分析还揭示了二次正则化的两个缺陷:(a)参数插值对训练超参数的依赖,这常导致训练不稳定;(b)对更深层赋予较低重要性,而深层通常是 DNNs 中发生遗忘的地方。通过对操作顺序的简单修改,我们表明这些缺陷可轻易避免,从而在平均遗忘降低 4.5% 的情况下平均准确率提高 6.2%。我们在不同设置下训练超过 2000 个模型,证实了结果的鲁棒性。代码见 \url{https://github.com/EkdeepSLubana/QRforgetting}
引用
@article{arxiv.2102.02805,
title = {How do Quadratic Regularizers Prevent Catastrophic Forgetting: The Role of Interpolation},
author = {Ekdeep Singh Lubana and Puja Trivedi and Danai Koutra and Robert P. Dick},
journal= {arXiv preprint arXiv:2102.02805},
year = {2022}
}
备注
Camera-ready for Conference on Lifelong Learning Agents (CoLLAs), 2022