超越锐度:面向高效持续学习的平坦性分解框架
机器学习
2026-01-13 v1
摘要
持续学习(CL)旨在使模型能够顺序学习多个任务而不遗忘先前知识。近期研究表明,优化朝向更平坦的损失最小值可以改善模型泛化。然而,现有的面向CL的锐度感知方法存在两个关键局限:(1)它们将锐度正则化视为统一信号而未区分其各分量的贡献;(2)它们引入了大量计算开销,阻碍了实际部署。为应对这些挑战,我们提出了FLAD,一种新颖的优化框架,将锐度感知扰动分解为梯度对齐分量和随机噪声分量,并证明仅保留噪声分量即可促进泛化。我们进一步引入了一种轻量级调度方案,使FLAD在受限训练时间下仍能保持显著的性能提升。FLAD可以无缝集成到各种CL范式中,并在多样化的实验设置中始终优于标准和锐度感知优化器,展示了其在CL中的有效性和实用性。
引用
@article{arxiv.2601.07636,
title = {Beyond Sharpness: A Flatness Decomposition Framework for Efficient Continual Learning},
author = {Yanan Chen and Tieliang Gong and Yunjiao Zhang and Wen Wen},
journal= {arXiv preprint arXiv:2601.07636},
year = {2026}
}
备注
Accepted by AAAI 2026