中文

面向任务的动态上下文导向分解低秩适配:减少遗忘与加速收敛

机器学习 2025-06-17 v1 人工智能 计算与语言 计算机视觉与模式识别

摘要

传统的低秩适配方法在构建适配器时不考虑数据上下文,导致微调性能次优以及固有世界知识的严重遗忘。在本文中,我们提出了上下文导向分解适配(CorDA),一种以任务感知方式初始化适配器的新方法。具体来说,我们开发了上下文导向奇异值分解,其中我们使用来自目标任务的采样数据收集每个线性层的输入激活协方差矩阵,并对权重矩阵与其对应协方差矩阵的乘积应用SVD。通过这种方式,任务特定能力被压缩到主成分中。由于任务感知,我们的方法实现了两种可选的适配模式:知识保留模式(KPM)和指令预览模式(IPM),提供了在冻结主成分以保留其关联知识或适配它们以更好地学习新任务之间的灵活性。我们进一步通过推导一个反映任务特定主成分紧凑性的指标开发了CorDA++,然后基于同一指标引入动态协方差选择和动态秩分配策略。这两种策略为每个层提供了最具代表性的协方差矩阵和适当的秩分配。实验结果表明,CorDA++显著优于CorDA。KPM中的CorDA++不仅实现了比LoRA更好的微调性能,还减轻了大型语言模型和视觉语言模型中预训练知识的遗忘。对于IPM,我们的方法展现出更快的收敛速度,例如比QLoRA快4.5倍,并在各种场景中提升了适配性能,超越了强大的基线方法。我们的方法已集成到Hugging Face开发的PEFT库中。

关键词

引用

@article{arxiv.2506.13187,
  title  = {Dynamic Context-oriented Decomposition for Task-aware Low-rank Adaptation with Less Forgetting and Faster Convergence},
  author = {Yibo Yang and Sihao Liu and Chuan Rao and Bang An and Tiancheng Shen and Philip H. S. Torr and Ming-Hsuan Yang and Bernard Ghanem},
  journal= {arXiv preprint arXiv:2506.13187},
  year   = {2025}
}