任务特定方向:定义、探索与参数高效微调中的应用
计算与语言
2026-01-28 v5 计算机视觉与模式识别
机器学习
摘要
大型语言模型在下游任务上表现突出,但对所有参数进行完全微调需要大量资源。为此,已发展出诸如 LoRA 等参数高效微调(PEFT)策略。本文深入探讨了任务特定方向(TSDs)的概念,这些方向对于在PEFT中将大型模型从预训练状态过渡到任务特定增强至关重要。我们提出了明确定义这些方向的框架,并探讨其属性和实际应用挑战。随后,我们引入一种新方法,即 LoRA-Dash,旨在最大化TSD在微调过程中的影响,从而提高针对特定任务的模型性能。此外,基于我们对TSD的探索,我们关注PEFT的一个重要问题:LoRA的初始化。虽然一些工作指出了初始化对LoRA性能的重要性并提出了各种策略,但这些方法往往是经验性的且不具任务特定性。为此,我们提出LoRA-Init。从TSD出发,我们识别在针对下游任务进行微调时最需要调整的方向。通过对LoRA中的矩阵以这些方向进行初始化,LoRA-Init显著提升了LoRA的性能。此外,我们可以将LoRA-Dash和LoRA-Init组合,创建最终基于TSDs的LoRA版本,称为LoRA-TSD。大量实验最终证明这些方法的有效性,深入分析进一步揭示了其成功背后的机制。
引用
@article{arxiv.2409.01035,
title = {Task-Specific Directions: Definition, Exploration, and Utilization in Parameter Efficient Fine-Tuning},
author = {Chongjie Si and Zhiyi Shi and Shifan Zhang and Xiaokang Yang and Hanspeter Pfister and Wei Shen},
journal= {arXiv preprint arXiv:2409.01035},
year = {2026}
}
备注
2026, TPAMI, Codes in https://github.com/Chongjie-Si/Subspace-Tuning