联合在线与离线强化学习:用于多轮代码生成的情境式 bandit 学习
机器学习
2026-02-04 v1 人工智能
计算与语言
软件工程
摘要
近年来,人们对在真实任务上(如多轮代码生成)使用强化学习 (RL) 训练大型语言模型 (LLM) 的研究兴趣显著增加。尽管在线 RL 在性能上优于离线 RL,但其更高的训练成本和不稳定性阻碍了广泛采用。本文基于将多轮代码生成建模为可恢复的马尔可夫决策过程的观察,我们提出了一种结合在线和离线 RL 优势的情境式 bandit 学习方法(Cobalt),该方法将参考 LLM 收集的代码生成轨迹并将其划分为作为情境提示的部分轨迹。随后,在在线 bandit 学习期间,LLM 被训练通过单步代码生成来完成每个部分轨迹提示。Cobalt 在基于 GRPO 和 VeRPO 的两个多轮在线 RL 基线之上,显著优于它们,使 R1-Distill 8B 和 Qwen3 8B 在 LiveCodeBench 上的 Pass@1 分数提升最高可达 9.0 和 6.2 个绝对值。我们还分析了 LLM 的情境下奖励欺骗行为,并通过加入扰动轨迹来增强 Cobalt 训练以缓解此问题。总体而言,我们的结果表明 Cobalt 是解决诸如多轮代码生成等迭代决策任务的有前景的解决方案。我们的代码和数据已公开于 https://github.com/OSU-NLP-Group/cobalt。
关键词
引用
@article{arxiv.2602.03806,
title = {Bridging Online and Offline RL: Contextual Bandit Learning for Multi-Turn Code Generation},
author = {Ziru Chen and Dongdong Chen and Ruinan Jin and Yingbin Liang and Yujia Xie and Huan Sun},
journal= {arXiv preprint arXiv:2602.03806},
year = {2026}
}