中文

基于离线强化学习的 LLM 代码生成后训练高效方法

人工智能 2026-05-28 v1

摘要

使用在线强化学习(RL)进行后训练是 LLM(包括代码生成模型)的重要训练步骤。然而,代码生成的在线 RL涉及 LLM 的推理和对生成输出的验证,这需要相当的时间和资源。本文探索了利用现有代码数据集应用离线 RL到代码生成模型上的方法。我们的实验表明,离线 RL是提高 LLM 性能的有效训练策略。我们展示了离线 RL对小型 LLM 和具有挑战性的代码问题尤其有益。

关键词

引用

@article{arxiv.2605.28409,
  title  = {Efficient Post-training of LLMs for Code Generation With Offline Reinforcement Learning},
  author = {Mingze Wu and Abhinav Anand and Shweta Verma and Mira Mezini},
  journal= {arXiv preprint arXiv:2605.28409},
  year   = {2026}
}