GeLoRA:用于高效LoRA微调的几何自适应秩
机器学习
2024-12-19 v3 几何拓扑
机器学习
摘要
微调大型语言模型(LLM)因需要更新所有参数而计算密集。低秩适应(LoRA)通过仅修改部分权重来提高效率,但在表达性与计算成本之间引入了权衡:较低的秩可节省资源但限制表达性,而较高的秩可增强表达性但增加成本。尽管近期在自适应LoRA技术方面取得了进展,现有方法仍缺乏用于优化模型性能与效率之间权衡的理论依据。我们提出了几何低秩适应(GeLoRA),一种新型框架,通过计算隐藏状态表示的内在维度来自适应选择LoRA秩。我们展示,内在维数为LoRA矩阵的最优秩提供下界,允许进行原则性选择,在效率和表达性之间进行平衡。GeLoRA根据各层输入和输出表示的内在维数动态调整秩,认识到并非所有模型参数对微调都同等重要。在多个任务上的实证验证表明,GeLoRA在相同参数预算下 consistently 超过最新基线。
引用
@article{arxiv.2412.09250,
title = {GeLoRA: Geometric Adaptive Ranks For Efficient LoRA Fine-tuning},
author = {Abdessalam Ed-dib and Zhanibek Datbayev and Amine Mohamed Aboussalah},
journal= {arXiv preprint arXiv:2412.09250},
year = {2024}
}