学习遗忘:自适应权力衰减的持续学习
机器学习
2026-05-01 v1 神经与进化计算
摘要
具有有限容量的持续学习智能体必须在获取新知识与保留旧知识之间进行平衡。这需要控制遗忘不再所需的知识,以释放容量以学习。将权力衰减视为遗忘机制,可发挥此作用,通过逐渐丢弃存储在权重中的信息。然而,固定标量权力衰减会随时间均匀驱动遗忘,并在所有参数上均匀发生,尽管其中一些参数编码的是稳定知识,而其他参数跟踪快速变化的目标。我们引入通过自适应衰减遗忘(FADE),通过近似元梯度下降在线调整各参数的权力衰减率。我们推导了FADE用于在线线性设置,并将其应用于神经网络的最终一层。我们的实证分析显示,FADE自动发现不同参数的不同衰减率,补充步长适应,始终通过在线跟踪和流式分类问题中优于固定权力衰减。
引用
@article{arxiv.2604.27063,
title = {Learning to Forget: Continual Learning with Adaptive Weight Decay},
author = {Aditya A. Ramesh and Alex Lewandowski and Jürgen Schmidhuber},
journal= {arXiv preprint arXiv:2604.27063},
year = {2026}
}
备注
Preprint version