站在分解的肩膀上看得更远:参数高效微调
机器学习
2024-12-30 v2 人工智能
计算机视觉与模式识别
摘要
大型基础模型在预训练与微调框架内的快速扩展已经强调,更大的模型往往能带来更好的结果。然而,大型基础模型的规模扩大导致了微调和参数存储成本的飙升,使得大规模的适应性调整变得不切实际。这一挑战催生了参数高效微调(PEFT)的发展,其专注于优化选定的参数子集,同时保持其余参数固定,从而显著降低计算和存储开销。尽管近年来PEFT取得了显著成功,但对这些方法背后基本原理的深入理解仍有待探索。为此,我们在此迈出第一步,通过从分解的角度剖析所有方法来统一它们。我们对这些方法进行了全面的数学分析,使我们能够深入探究其底层机制,并探索不同技术之间性能差异的原因。此外,受我们理论分析的启发,我们引入了两种新颖的PEFT方法以及一个简单而有效的框架,旨在提升PEFT技术在各种应用中的性能。我们在多个数据集上进行的实证验证证明了这些方法的有效性,展示了在我们的分析发现指导下,理论有效性和实际性能改进。我们相信,我们的工作将加深研究人员对PEFT及其他技术的理解,引发进一步思考,并推动整个社区的研究进展。
引用
@article{arxiv.2407.05417,
title = {See Further for Parameter Efficient Fine-tuning by Standing on the Shoulders of Decomposition},
author = {Chongjie Si and Xiaokang Yang and Wei Shen},
journal= {arXiv preprint arXiv:2407.05417},
year = {2024}
}
备注
Codes in https://github.com/Chongjie-Si/Subspace-Tuning