面向 LLM 推理的高效强化学习
机器学习
2025-06-13 v4 人工智能
摘要
我们提出了针对大语言模型(LLM)推理中的强化学习策略,旨在严格限制内存和计算资源,尤其关注与 LoRA 微调的兼容性。基于早期的策略梯度方法与基线减除,我们设计了无评论家的方法,这些方法仅针对小而有信息的输出标记子集,以减少内存使用并稳定训练。我们引入了 S-GRPO,即 Group Relative Policy Optimization 的随机变体,以及 T-SPMO,即基于标记级别前缀匹配的方法,用于细粒度的信用分配。应用于 Qwen2-1.5B,我们的方法将 SVAMP 数据集上的准确率从 46% 提升至 70% 以上,并在多位数乘法任务中表现出色。意外的是,在 LoRA 下的全标记 GRPO未能超过基础模型,这表明选择性标记级优化可能在低参数训练 regime 中发挥隐式正则化作用。
引用
@article{arxiv.2504.20834,
title = {Token-Efficient RL for LLM Reasoning},
author = {Alan Lee and Harry Tong},
journal= {arXiv preprint arXiv:2504.20834},
year = {2025}
}
备注
Title updated to "Token-Efficient RL for LLM Reasoning" to better reflect algorithmic focus. Revised abstract, intro, and conclusion. Paper shortened and typos fixed