SLCA++:释放顺序微调在预训练持续学习中的潜力
计算机视觉与模式识别
2024-08-16 v1 人工智能
机器学习
摘要
近年来,基于预训练的持续学习(CLPT)受到广泛关注,不再局限于从头训练的传统范式。使用强大的预训练模型(PTM)可以极大促进知识迁移并缓解灾难性遗忘,但也容易出现过拟合预训练知识到特定下游任务的问题。当前大多数方法通常将PTM冻结并引入任务特定的提示(prompt)来指导表示学习,结合推理时的提示选择过程。然而,由于提示参数容量有限,该策略在持续学习中仅表现出次优性能。相比之下,微调PTM的所有参数通常为表示学习提供最大潜力,使得顺序微调(Seq FT)成为CLPT中被忽视的基础基线。为此,我们从Seq FT的视角深入分析渐进过拟合问题。考虑到过快的表示学习和有偏的分类层构成了这一问题,我们提出先进的慢学习者配合分类器对齐(SLCA++)框架,以释放Seq FT的潜力,作为CLPT的强基线方法。我们的方法通过慢学习者选择性地降低骨干网络参数的学习率,并通过分类器对齐以事后方式对齐不相连的分类层。我们进一步通过对称交叉熵损失增强慢学习者的有效性,并采用参数高效策略实现SLCA++的Seq FT。在图像分类基准上的多种持续学习场景中,我们的方法提供了显著提升,并以较大优势超越了现有最先进方法。代码:https://github.com/GengDavid/SLCA。
引用
@article{arxiv.2408.08295,
title = {SLCA++: Unleash the Power of Sequential Fine-tuning for Continual Learning with Pre-training},
author = {Gengwei Zhang and Liyuan Wang and Guoliang Kang and Ling Chen and Yunchao Wei},
journal= {arXiv preprint arXiv:2408.08295},
year = {2024}
}
备注
This paper is an extension of our ICCV 23 paper (arXiv:2303.05118)