利用公共社区评分作为人类反馈的编程领域问答强化学习
计算与语言
2024-01-22 v1 人工智能
人机交互
摘要
在本研究中,我们调查了通过整合来自人类反馈的强化学习(RLHF)并利用Stack Overflow的评分来增强GPT Neo 125M在社区问答(CQA)中专注于编程领域的性能。采用了两种不同的奖励模型训练策略,用于使用近端策略优化(PPO)进行微调。值得注意的是,通过这种方法实现的性能提升与GPT Neo 2.7B参数变体相当。此外,引入了一个辅助评分机制,展示了传统语言指标在评估编程领域回答时的局限性。通过准确分析,本文审视了传统语言指标与我们基于人类偏好的奖励模型之间的分歧,强调了领域特定评估方法的必要性。通过阐明将RLHF应用于编程CQA的复杂性并强调上下文感知评估的重要性,本研究为通过聚焦人类反馈改进大型语言模型的持续努力做出了贡献。
引用
@article{arxiv.2401.10882,
title = {Reinforcement learning for question answering in programming domain using public community scoring as a human feedback},
author = {Alexey Gorbatovski and Sergey Kovalchuk},
journal= {arXiv preprint arXiv:2401.10882},
year = {2024}
}