LLM的自演化奖励学习
计算与语言
2025-06-04 v3 人工智能
摘要
基于人类反馈的强化学习(RLHF)是将语言模型与人类偏好对齐的关键技术,在GPT-4、ChatGPT和Llama 2等对话模型的成功中发挥着核心作用。应用RLHF的一个核心挑战在于训练一个可靠的奖励模型(RM),该模型依赖于通常由人类专家或先进AI系统提供的高质量标签。这些方法成本高昂,且可能引入影响语言模型响应的偏差。随着语言模型的改进,人类输入在进一步提升其性能方面可能变得不再有效。在本文中,我们提出了自演化奖励学习(SER),这是一种新颖的方法,其中RM生成额外的训练数据以迭代地自我改进。我们在多个数据集(如HH-RLHF和UltraFeedback)上使用Mistral和Llama 3等模型进行了广泛实验,并将SER与各种基线进行了比较。我们的结果表明,即使只有有限的人工标注数据,从自反馈中学习也能稳健地提升RM性能,从而增强大语言模型(LLMs)的能力。本论文的资源可在 https://aka.ms/ser 找到。
引用
@article{arxiv.2411.00418,
title = {Self-Evolved Reward Learning for LLMs},
author = {Chenghua Huang and Zhizhen Fan and Lu Wang and Fangkai Yang and Pu Zhao and Zeqi Lin and Qingwei Lin and Dongmei Zhang and Saravan Rajmohan and Qi Zhang},
journal= {arXiv preprint arXiv:2411.00418},
year = {2025}
}
备注
23 pages,6 figures,Accepted to ICLR 2025