中文

AdaGradSelect:面向高效SLM微调的参数自适应梯度引导层选择方法

机器学习 2025-12-19 v1 人工智能 性能

摘要

大型语言模型(LLMs)在众多自然语言处理任务上表现优异,但完全微调需要高昂的成本和大量内存。参数高效微调(PEFT)方法如LoRA通过向冻结的模型权重添加小型低秩更新来降低成本。然而,这些方法将训练限制在有限的子空间中,可能会降低性能。对于效率需求更高的小型语言模型(SLMs),我们提出AdaGradSelect,这是一种自适应选择性Transformer模块更新的方法。早期观察表明,仅更新梯度范数最大的Transformer模块可实现接近全参数微调的性能。基于此洞察,AdaGradSelect自适应选择要训练的模块。它结合了Dirichlet-based抽样(取决于过去各模块被更新频率)和ε-贪婪探索策略。该方法在早期训练中探索不同模块,逐渐在后期聚焦最重要的模块。实验表明,AdaGradSelect训练约快12%,GPU内存使用降低35%,同时实现接近全参数微调的性能。在GSM8K数据集上,相较于LoRA(秩256),在Qwen2.5-0.5B、LLaMA3.2-1B和Phi4-mini-3.8B等模型上平均提升约3%。在MATH数据集上也实现了相似的准确率。总体而言,AdaGradSelect为传统微调方法提供了更有效且资源更高效的替代方案。

关键词

引用

@article{arxiv.2512.15764,
  title  = {AdaGradSelect: An adaptive gradient-guided layer selection method for efficient fine-tuning of SLMs},
  author = {Anshul Kumar and Gagan Raj Gupta and Manisha Chawla},
  journal= {arXiv preprint arXiv:2512.15764},
  year   = {2025}
}