中文

ACE-RLHF:基于大语言模型和人类反馈强化学习的自动化代码评估与索克拉特式反馈生成工具

机器学习 2025-04-08 v1

摘要

自动化程序修复工具用于生成反馈并提出纠错方法。最先进(SOTA)代码修复方法依赖数据驱动方法,常常无法解决复杂编程问题。要理解前所未有的编程问题的自然语言表达,使用大语言模型(LLM)进行代码反馈生成至关重要。LLM 生成的反馈比编译器生成的错误信息更具可读性,强化学习与人类反馈(RLHF)进一步通过集成人类在环式反馈来提升质量,这有助于零基础学生以交互式方式学习编程。我们正在应用 RLHF 微调技术,以期望产生一种具有提示解答编程问题的索克拉特式响应。我们提出一种通过 RLHF 微调大语言模型生成代码反馈的工具,称为自动化代码评估与 RLHF(ACE-RLHF),该工具结合了两种不同的 SOTA 优化技术的两个开源 LLM 模型。我们在包含基础和竞赛级别编程问题的两个基准数据集上评估反馈质量,其中后者由我们自行提出。我们使用 Llama-3-7B-Proximal-policy optimization 在自动化评估中实现了比 RL-free SOTA 技术高出 2-5% 的准确率,与基于奖励模型无 RL 的 RL with AI Feedback(RLAIF)相比,准确率相似或略高。我们在进行手动评估时使用 GPT-3.5 Best-of-n optimization 实现了近 40% 的准确率提升。

关键词

引用

@article{arxiv.2504.04657,
  title  = {ACE-RLHF: Automated Code Evaluation and Socratic Feedback Generation Tool using Large Language Models and Reinforcement Learning with Human Feedback},
  author = {Tasnia Rahman and Sathish A. P. Kumar and Sumit Jha and Arvind Ramanathan},
  journal= {arXiv preprint arXiv:2504.04657},
  year   = {2025}
}

备注

9 pages, 3 figures