Hybrid-LoRA:弥合全量微调与低秩适配以用于训练后阶段
机器学习
2026-05-20 v1 人工智能
摘要
训练后阶段已成为使大型语言模型适应复杂下游行为的关键环节,包括指令遵循、偏好对齐和多步推理。带有可验证奖励的强化学习近期已成为一种尤为有效的训练后范式,用于提升推理能力,其中如 GRPO 和 GSPO 等无评论家算法实现了可扩展的优化。然而,使用全量微调的 RLVR 训练后阶段需要大量 GPU 内存并产生高昂的训练成本。尽管参数高效微调方法(如低秩适配)有效降低了计算成本,但在复杂推理任务的训练后阶段中,它们与全量微调相比通常存在明显的性能差距。在本文中,我们提出了 Hybrid-LoRA,这是一种高效的混合训练后框架,其对一小部分不太适合低秩适配的模块选择性地应用全量微调,同时使用 LoRA 适配其余组件。我们引入了一种新颖的 Hybrid-LoRA 分数,用于在固定参数预算下根据候选模块对低秩适配的敏感性对其进行排序。实验表明,在 10% 的全量微调模块预算下,Hybrid-LoRA 紧密匹配全量微调性能,其余候选模块由 LoRA 适配,始终优于四个最先进的 PEFT 训练后基线,相较于最佳基线实现了高达 5.65% 且平均 4.36% 的提升。
引用
@article{arxiv.2605.18822,
title = {Hybrid-LoRA: Bridging Full Fine-Tuning and Low-Rank Adaptation for Post-Training},
author = {Chengqian Zhang and Wei Zhu and Kyumin Lee},
journal= {arXiv preprint arXiv:2605.18822},
year = {2026}
}