关于连续学习中参数更新幅度对遗忘与泛化影响的探索
机器学习
2026-02-25 v1
摘要
参数更新幅度被认为是连续学习中的关键因素。然而,大多数现有研究关注于设计多样化的更新策略,而对 underlying机制的理论理解仍有限。因此,我们从参数更新幅度的角度来刻画模型的遗忘现象,将其形式化为由参数空间中特定于任务的漂移导致的知识退化,这一现象在以往研究中由于假设统一参数空间而未被充分捕捉。通过推导最小化遗忘的 optimal parameter update magnitude,我们将两种代表性更新范式——冻结训练和初始化训练——纳入受约束参数更新的优化框架中。我们的理论结果进一步表明,在参数距离较小的序列任务中,冻结训练比初始化训练在泛化和遗忘方面表现更好。这些理论见解激发了一种新型的混合参数更新策略,通过根据梯度方向自适应调整更新幅度。深度神经网络上的实验表明,这种混合方法优于标准训练策略,为设计高效且可扩展的连续学习算法提供了新的理论视角和实践启发。
引用
@article{arxiv.2602.20796,
title = {Exploring the Impact of Parameter Update Magnitude on Forgetting and Generalization of Continual Learning},
author = {JinLi He and Liang Bai and Xian Yang},
journal= {arXiv preprint arXiv:2602.20796},
year = {2026}
}