中文

基于 GRPO 的 LoRA 秩分配梯度研究: 实证分析

计算与语言 2026-05-11 v1

摘要

在监督微调 (SFT) 下,为 LoRA 分配自适应秩(将重要层分配更多参数,将不重要层分配更少参数)可持续提高效率。我们调查这种成功是否也适用于强化学习,具体为组相对政策优化 (GRPO)。使用 Qwen 2.5 1.5B 模型在 GSM8K 上的梯度幅度轮廓化分析发现,情况并非如此:按比例分配秩会使准确率下降 4.5 分(70.0% vs. 74.5%),尽管参数预算相同。我们识别了两种导致此失败的机制。首先,GRPO 下的梯度景观远小于 SFT 下,层级重要性比值仅为 2.17 倍,与 SFT 文献中报告的 >10 倍相比,所有层都携带有意义的梯度信号,没有层是 truly idle 的。其次,我们发现梯度放大效应:非均匀分配会将重要性扩大从 2.17 倍提升至 3.00 倍,形成正反馈回路,使得高秩层吸收更多梯度,而低秩层被逐渐压制。我们的结果表明,在 RL 环境中,梯度重要性并不预测容量需求,应避免直接将 SFT 时代的秩分配方法搬到对齐训练中使用。

关键词

引用

@article{arxiv.2605.07366,
  title  = {Gradient-Based LoRA Rank Allocation Under GRPO: An Empirical Study},
  author = {Yash Ganpat Sawant},
  journal= {arXiv preprint arXiv:2605.07366},
  year   = {2026}
}

备注

4 pages + references