评估 RLVR 的参数高效方法
机器学习
2026-01-01 v2
摘要
我们在可验证奖励的强化学习(RLVR)范式下系统评估了参数高效微调(PEFT)方法。RLVR 激励语言模型通过可验证的反馈来增强其推理能力;然而,尽管 LoRA 等方法被广泛使用,适用于 RLVR 的最佳 PEFT 架构仍未确定。在本研究中,我们首次在数学推理基准上对 DeepSeek-R1-Distill 系列中的 12 余种 PEFT 方法进行了全面评估。我们的实证结果对标准 LoRA 的默认采用提出了挑战,并得出三个主要发现。首先,我们证明了诸如 DoRA、AdaLoRA 和 MiSS 等结构变体始终优于 LoRA。其次,我们在基于 SVD 的初始化策略(\textit{例如} PiSSA、MiLoRA)中发现了谱崩溃现象,将其失败归因于主成分更新与 RL 优化之间的根本错位。此外,我们的消融实验表明,极端的参数削减(\textit{例如} VeRA、Rank-1)严重瓶颈了推理能力。我们进一步进行了消融研究和缩放实验以验证我们的发现。本工作为倡导对参数高效 RL 方法进行更多探索提供了明确的指南。
引用
@article{arxiv.2512.23165,
title = {Evaluating Parameter Efficient Methods for RLVR},
author = {Qingyu Yin and Yulun Wu and Zhennan Shen and Sunbowen Li and Zhilin Wang and Yanshu Li and Chak Tou Leong and Jiale Kang and Jinjin Gu},
journal= {arXiv preprint arXiv:2512.23165},
year = {2026}
}
备注
Preprint