面向大语言模型代码生成的众包人类反馈强化学习对齐
人工智能
2025-03-20 v1
摘要
本文研究了人类反馈如何通过众包计算集成到强化学习(RLHF)中,以增强大型语言模型(LLM)用于代码生成的文本到代码转换能力。我们演示了自己的贝叶斯优化框架支持代码生成中的AI对齐,通过分布式反馈收集负担,凸显收集高质量人类反馈的价值。我们的实证评估表明,这种方法的有效性,展示了如何有效训练LLM代理以提高文本到代码的生成能力。我们的贝叶斯优化框架可为通用领域特定语言设计,推动大型语言模型能力与人类反馈在AI辅助编程中的对齐。
引用
@article{arxiv.2503.15129,
title = {Aligning Crowd-sourced Human Feedback for Reinforcement Learning on Code Generation by Large Language Models},
author = {Man Fai Wong and Chee Wei Tan},
journal= {arXiv preprint arXiv:2503.15129},
year = {2025}
}