Sparse-RL:通过稳定稀疏展开打破大语言模型强化学习中的内存墙
机器学习
2026-03-31 v2 人工智能
计算与语言
摘要
强化学习(RL)已成为激发大语言模型(LLMs)复杂推理能力的关键。然而,在长时程展开过程中存储键值(KV)缓存所带来的巨大内存开销成为一个关键瓶颈,常常阻碍在有限硬件上进行高效训练。虽然现有的KV压缩技术为推理提供了一种补救措施,但将其直接应用于RL训练会导致严重的策略失配,引发灾难性的性能崩溃。为了解决这个问题,我们引入了Sparse-RL,它能够在稀疏展开下实现稳定的RL训练。我们表明,不稳定性源于稠密旧策略、稀疏采样器策略和学习器策略之间的根本性策略失配。为了缓解这个问题,Sparse-RL结合了稀疏感知拒绝采样和基于重要性的重加权,以纠正由压缩引起的信息损失所引入的离策略偏差。实验结果表明,与稠密基线相比,Sparse-RL减少了展开开销,同时保持了性能。此外,Sparse-RL本质上实现了稀疏感知训练,显著增强了模型在稀疏推理部署期间的鲁棒性。相应的训练数据和代码已在仓库中公开。
引用
@article{arxiv.2601.10079,
title = {Sparse-RL: Breaking the Memory Wall in LLM Reinforcement Learning via Stable Sparse Rollouts},
author = {Sijia Luo and Xiaokang Zhang and Yuxuan Hu and Bohan Zhang and Ke Wang and Jinbo Su and Mengshu Sun and Lei Liang and Jing Zhang},
journal= {arXiv preprint arXiv:2601.10079},
year = {2026}
}