基于增量低秩更新的预训练模型遗忘现象实证分析
机器学习
2025-05-21 v2
摘要
通过诸如HuggingFace等平台向公众广泛开放获取的大型预训练基础模型已风靡全球深度学习实践领域。神经网络训练的经典管道通常包括对这些预训练模型进行微调,以适应小型目标数据集,而不是从头训练。在大型模型情况下,甚至可以在有限硬件上使用称为低秩适应(LoRA)的低秩训练技术完成。虽然低秩训练在持续学习setting中已受到研究,既存作品往往考虑在学习完每个任务后存储所学到的适配器及其余模型,却很少尝试通过合并LoRA与现有权重来修改预训练模型的权重。在本文中,我们调查了这一设定,研究LoRA秩对预训练基础任务遗忘以及后续任务的塑性和遗忘的影响。我们观察到,这一秩对预训练和下游任务的遗忘都有重要影响。我们还观察到,使用此方式微调的视觉Transformer exhibits一种“情境化”遗忘现象,这一行为在残差网络中观察不到,认为此前的持续学习工作尚未观察到。
关键词
引用
@article{arxiv.2405.18069,
title = {An Empirical Analysis of Forgetting in Pre-trained Models with Incremental Low-Rank Updates},
author = {Albin Soutif--Cormerais and Simone Magistri and Joost van de Weijer and Andew D. Bagdanov},
journal= {arXiv preprint arXiv:2405.18069},
year = {2025}
}
备注
CoLLAs 2024 accepted paper, PMLR 274:996-1012