中文

超越锐度:面向高效持续学习的平坦性分解框架

机器学习 2026-01-13 v1

摘要

持续学习(CL)旨在使模型能够顺序学习多个任务而不遗忘先前知识。近期研究表明,优化朝向更平坦的损失最小值可以改善模型泛化。然而,现有的面向CL的锐度感知方法存在两个关键局限:(1)它们将锐度正则化视为统一信号而未区分其各分量的贡献;(2)它们引入了大量计算开销,阻碍了实际部署。为应对这些挑战,我们提出了FLAD,一种新颖的优化框架,将锐度感知扰动分解为梯度对齐分量和随机噪声分量,并证明仅保留噪声分量即可促进泛化。我们进一步引入了一种轻量级调度方案,使FLAD在受限训练时间下仍能保持显著的性能提升。FLAD可以无缝集成到各种CL范式中,并在多样化的实验设置中始终优于标准和锐度感知优化器,展示了其在CL中的有效性和实用性。

关键词

引用

@article{arxiv.2601.07636,
  title  = {Beyond Sharpness: A Flatness Decomposition Framework for Efficient Continual Learning},
  author = {Yanan Chen and Tieliang Gong and Yunjiao Zhang and Wen Wen},
  journal= {arXiv preprint arXiv:2601.07636},
  year   = {2026}
}

备注

Accepted by AAAI 2026