基于扩散模型的秩1 Fisher 避免灾难性遗忘
机器学习
2026-01-28 v2
摘要
灾难性遗忘仍是神经网络模型持续学习中的核心障碍。流行的方法——重放和弹性权重Consolidation(EWC)——存在局限性:重放需要强大的生成器且易受分布漂移影响,而EWC隐式假设跨任务共享最优解,通常使用对角Fisher近似。在本工作中,我们研究了扩散模型的梯度几何,这些模型已经能够产生高质量的重放数据。我们提供了理论和实证证据表明,在低信噪比(SNR) regime下,单个样本的梯度变得高度一致,导致的经验Fisher实际上是秩1且与平均梯度对齐。利用这一结构,我们提出了EWC的秩1变体,计算成本与对角近似相当,却捕获了主导曲率方向。在本工作中,我们将该惩罚与重放方法结合,以鼓励跨任务参数共享,同时减轻漂移。在类递增图像生成数据集(MNIST、FashionMNIST、CIFAR-10、ImageNet-1k)上,我们的方法在平均FID和遗忘方面均优于重放-only和对角-EWC基线。特别是在MNIST和FashionMNIST上几乎消除遗忘,在ImageNet-1k上遗忘减少了超过一半。这些结果表明,扩散模型容许近似秩1的Fisher。通过更好的Fisher估计,EWC成为强大的补充:重放鼓励跨任务参数共享,而EWC有效约束重放引起的漂移。
引用
@article{arxiv.2509.23593,
title = {Avoid Catastrophic Forgetting with Rank-1 Fisher from Diffusion Models},
author = {Zekun Wang and Anant Gupta and Zihan Dong and Christopher J. MacLellan},
journal= {arXiv preprint arXiv:2509.23593},
year = {2026}
}
备注
19 pages, 14 figures