中文

GRASS:基于梯度的自适应层级重要性抽样,用于高效大语言模型微调

计算与语言 2026-04-10 v1 机器学习

摘要

大型语言模型的全参数微调受限于较大的GPU内存需求。低秩适应方法通过仅更新参数的子集来缓解这一挑战,但这些方法常常限制模型的表达能力,导致性能低于全参数微调。层级微调方法作为一种替代方案,通过静态层级重要性抽样策略实现内存高效的训练。然而,这些方法忽略了层级重要性在不同任务和训练阶段的变化,导致在下游任务上性能不佳。为解决这些限制,我们提出了GRASS——一种梯度基的自适应层级重要性抽样框架。GRASS利用平均梯度范数作为任务感知和训练阶段感知的指标来估计层级重要性。此外,GRASS通过自适应训练策略自适应调整层级抽样概率。我们还引入了一种层级优化器状态卸载机制,通过重叠计算和通信进一步减少内存使用,同时保持相当的训练吞吐量。跨越多个模型和基准的广泛实验表明,GRASS consistently优于最先进的方法,在准确率上提升最高可达4.38分,内存使用降低最高可达19.97%。

关键词

引用

@article{arxiv.2604.07808,
  title  = {GRASS: Gradient-based Adaptive Layer-wise Importance Sampling for Memory-efficient Large Language Model Fine-tuning},
  author = {Kaiyuan Tian and Yu Tang and Gongqingjian Jiang and Baihui Liu and Yifu Gao and Xialin Su and Linbo Qiao and Dongsheng Li},
  journal= {arXiv preprint arXiv:2604.07808},
  year   = {2026}
}

备注

Accepted by ACL 2026 Findings