通过 C-Flat 增强持续学习
机器学习
2024-11-04 v2 计算机视觉与模式识别
摘要
模型在按序到达的任务中增量获取动态更新知识时的泛化能力,对于解决持续学习(Continual Learning, CL)中的稳定性-可塑性困境至关重要。寻求处于具有均匀低损失或平滑梯度的邻域中的平坦极小值的权重损失景观锐度最小化,已被证明是相比于基于损失最小化的优化器(如 SGD)更能提升模型泛化能力的强训练机制。然而,仅有少数工作探讨了 CL 的这一训练机制,证明了专门设计的零阶锐度优化器可以提升 CL 性能。在本工作中,我们提出了一种针对 CL 量身定制的具有更平坦损失景观的持续平坦度(Continual Flatness, C-Flat)方法。C-Flat 易于调用,仅需一行代码,并且可即插即用于任何 CL 方法。本文提出了应用于所有 CL 类别的 C-Flat 通用框架,并与损失极小值优化器和基于平坦极小值的 CL 方法进行了全面比较,表明我们的方法几乎在所有情况下都能提升 CL 性能。代码可在 https://github.com/WanNaa/C-Flat 获取。
引用
@article{arxiv.2404.00986,
title = {Make Continual Learning Stronger via C-Flat},
author = {Ang Bian and Wei Li and Hangjie Yuan and Chengrong Yu and Mang Wang and Zixiang Zhao and Aojun Lu and Pengliang Ji and Tao Feng},
journal= {arXiv preprint arXiv:2404.00986},
year = {2024}
}