面向大语言模型的离线与在线强化学习的桥接
计算与语言
2025-06-27 v1
摘要
我们探讨了强化学习方法在大语言模型从离线到准在线到完全在线场景下的有效性,这些场景涵盖可验证任务和非可验证任务。我们的实验涵盖在可验证的数学题以及非可验证的指令遵循任务上,并配以一套针对两者的基准评估。在这些设置下,我们广泛比较了在线和准在线直接偏好优化(Direct Preference Optimization)和群体奖励策略优化(Group Reward Policy Optimization)目标,意外发现这些变体在性能和收敛性方面相似,均显著优于离线方法。我们对训练动力学和超参数选择策略进行了详细分析,以实现最佳结果。最后,我们展示了使用可验证和非可验证奖励联合进行多任务处理可在两类任务中提升性能。
引用
@article{arxiv.2506.21495,
title = {Bridging Offline and Online Reinforcement Learning for LLMs},
author = {Jack Lanchantin and Angelica Chen and Janice Lan and Xian Li and Swarnadeep Saha and Tianlu Wang and Jing Xu and Ping Yu and Weizhe Yuan and Jason E Weston and Sainbayar Sukhbaatar and Ilia Kulikov},
journal= {arXiv preprint arXiv:2506.21495},
year = {2025}
}