GeoRA:面向 RLVR 的几何感知低秩适配
机器学习
2026-04-24 v3 人工智能
摘要
带可验证奖励的强化学习是改进大规模推理模型的关键范式。与监督微调不同,RLVR 表现出独特的优化动态,且对预训练几何结构的保持十分敏感。然而,现有的参数高效方法在此场景下面临关键局限。低秩适配方法(如 PiSSA)主要为监督微调设计,未考虑 RLVR 独特的优化动态与几何结构。反之,直接微调 RLVR 偏好的非结构化稀疏参数子空间,会在现代硬件上遭遇效率瓶颈。为应对这些挑战,我们提出了 GeoRA(几何感知低秩适配),一种专为 RLVR 量身定制的低秩适配方法。具体而言,GeoRA 利用 RL 更新子空间各向异性且可压缩的结构,通过奇异值分解提取其主方向以初始化低秩适配器,同时在训练期间冻结残差分量作为结构锚点。该设计保留了预训练结构并实现了高效的稠密计算。在参数量从 1.5B 到 32B 的 Qwen 和 Llama 模型上的实验表明,GeoRA 在数学、医学和编程的 RLVR 设置中始终优于强力的低秩基线,同时在域外任务上展现出更强的泛化能力和更少的遗忘。
引用
@article{arxiv.2601.09361,
title = {GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR},
author = {Jiaying Zhang and Lei Shi and Jiguo Li and Jun Xu and Jiuchong Gao and Jinghua Hao and Renqing He},
journal= {arXiv preprint arXiv:2601.09361},
year = {2026}
}
备注
Accepted at ACL 2026 Main