解读层间信息:利用多层表示进行基于预训练模型的无排练持续学习
机器学习
2024-07-08 v3 计算机视觉与模式识别
摘要
我们研究持续学习(CL)问题,其中模型必须从非平稳分布中学习一系列任务,同时在遇到新经验时保留先验知识。随着基础模型的发展,CL 研究已从最初的从零学习范式转向利用大规模预训练的通用特征。然而,使用预训练模型的 CL 现有方法主要侧重于从最终表示层中分离特定类别的特征,忽略了中间表示在捕获对领域漂移更具不变性的低级与中级特征的潜力。在本工作中,我们提出了 LayUP,一种新的基于原型的 CL 方法,利用预训练网络多个中间层的二阶特征统计量。我们的方法概念上简单,不需要访问先前数据,且可直接与任何基础模型配合使用。LayUP 在七个类增量学习基准中的四个、所有三个领域增量学习基准以及七个在线持续学习基准中的六个上超越了 SOTA,同时与现有基线相比显著降低了内存与计算需求。我们的结果表明,在 CL 中充分利用预训练模型的表示能力远超其最终嵌入。
引用
@article{arxiv.2312.08888,
title = {Read Between the Layers: Leveraging Multi-Layer Representations for Rehearsal-Free Continual Learning with Pre-Trained Models},
author = {Kyra Ahrens and Hans Hergen Lehmann and Jae Hee Lee and Stefan Wermter},
journal= {arXiv preprint arXiv:2312.08888},
year = {2024}
}
备注
Accepted for publication in Transactions of Machine Learning Research (TMLR) journal