基于梯度手术的低秩适配器初始化用于持续学习
机器学习
2026-05-14 v1
摘要
LoRA 因其参数高效、跨任务模块化以及与重播策略的兼容性,被广泛用于大型语言模型的持续微调。然而,LoRA 基于的持续学习仍然容易遭受灾难性遗忘,其严重程度取决于 successive task gradients 的相互作用:当连续任务的梯度发生冲突时,标准的适配器初始化会将更新通道导入覆盖先前学习方向的子空间。我们提出 SLICE,一种基于梯度手术的 LoRA 适配器初始化方法,用于持续学习。SLICE 收集当前任务和来自先前任务回放缓冲区的梯度,通过投影算子进行协调,并通过截断奇异值分解(truncated SVD)分解结果,以初始化适配器权重。我们在 TRACE 基准和一系列 Super-NI 任务上进行评估,其中包括我们构造的对抗性 Super-NI 任务序列,这些任务序列通过从任务对中挖掘最大反向梯度的任务对来构建。相对于 vanilla LoRA、LoRA-GA 和 LoRAM,SLICE 在稳定-塑性权衡上始终实现更好的表现,在 Average Performance、Final Performance 和 Forgetting 指标上均取得更好的结果,同时在标准和对抗性持续学习序列中保持 General Performance 和 In Context Performance。
引用
@article{arxiv.2605.12752,
title = {Low-Rank Adapters Initialization via Gradient Surgery for Continual Learning},
author = {Joana Pasquali and Ramiro N. Barros and Arthur S. Bianchessi and Vinícius Conte Turani and João Vitor Boer Abitante and Rafaela Cappelari Ravazio and Christian Mattjie and Otávio Parraga and Lucas S. Kupssinskü and Rodrigo C. Barros},
journal= {arXiv preprint arXiv:2605.12752},
year = {2026}
}