中文

GeLoRA:用于高效LoRA微调的几何自适应秩

机器学习 2024-12-19 v3 几何拓扑 机器学习

摘要

微调大型语言模型(LLM)因需要更新所有参数而计算密集。低秩适应(LoRA)通过仅修改部分权重来提高效率,但在表达性与计算成本之间引入了权衡:较低的秩可节省资源但限制表达性,而较高的秩可增强表达性但增加成本。尽管近期在自适应LoRA技术方面取得了进展,现有方法仍缺乏用于优化模型性能与效率之间权衡的理论依据。我们提出了几何低秩适应(GeLoRA),一种新型框架,通过计算隐藏状态表示的内在维度来自适应选择LoRA秩。我们展示,内在维数为LoRA矩阵的最优秩提供下界,允许进行原则性选择,在效率和表达性之间进行平衡。GeLoRA根据各层输入和输出表示的内在维数动态调整秩,认识到并非所有模型参数对微调都同等重要。在多个任务上的实证验证表明,GeLoRA在相同参数预算下 consistently 超过最新基线。

关键词

引用

@article{arxiv.2412.09250,
  title  = {GeLoRA: Geometric Adaptive Ranks For Efficient LoRA Fine-tuning},
  author = {Abdessalam Ed-dib and Zhanibek Datbayev and Amine Mohamed Aboussalah},
  journal= {arXiv preprint arXiv:2412.09250},
  year   = {2024}
}