中文

Coffee-Gym:用于评估和改进对错误代码自然语言反馈的环境

计算与语言 2024-10-07 v2

摘要

本文提出了 Coffee-Gym,一个用于训练提供代码编辑反馈模型的综合性强化学习环境。Coffee-Gym 包括两个主要组件:(1)Coffee,一个包含人类对编程问题的代码编辑痕迹以及针对编辑错误代码的机器编写反馈的数据集;(2)CoffeeEval,一个忠实反映反馈有帮助性的奖励函数,通过评估修订后代码在单元测试中的性能来实现。有了它们,Coffee-Gym 解决了用于训练具有 RL 反馈模型的高质量数据集的稀缺问题,并比现有 SOTA 奖励模型(即 GPT-4)提供更准确的奖励。通过应用 Coffee-Gym,我们能够引导表现优于基线的反馈模型,增强开源代码 LLM 的代码编辑能力,使其与闭源 LLM 相当。我们公开了数据集和模型检查点。

关键词

引用

@article{arxiv.2409.19715,
  title  = {Coffee-Gym: An Environment for Evaluating and Improving Natural Language Feedback on Erroneous Code},
  author = {Hyungjoo Chae and Taeyoon Kwon and Seungjun Moon and Yongho Song and Dongjin Kang and Kai Tzu-iunn Ong and Beong-woo Kwak and Seonghyeon Bae and Seung-won Hwang and Jinyoung Yeo},
  journal= {arXiv preprint arXiv:2409.19715},
  year   = {2024}
}

备注

EMNLP2024