GFRIEND:通过高效直接偏好优化实现生成式少样本奖励推理
机器学习
2025-06-11 v1 人工智能
摘要
利用少样本数据训练高性能奖励模型的能力,对于提升来自人类反馈的强化学习(RLHF)的效率与可扩展性至关重要。我们提出了一种数据增强与扩展框架,使在小数据集上训练的生成式奖励模型能够达到与大规模数据集上训练的模型相当的性能。训练生成式奖励模型的传统方法,如直接偏好优化(DPO),受限于样本配对效率低下和数据多样性不足。本工作引入了偏好精炼,利用思维链(CoT)采样来揭示多样且高质量的偏好关系。它还结合了基于困惑度的评分机制来分配精细的偏好等级,并利用多级直接偏好优化(M-DPO)使模型能够捕捉样本间更细粒度的偏好差异。实验结果表明,所提方法显著提升了数据效率和模型性能,使少样本设置下训练的奖励模型能够达到与大规模数据集上训练的模型相当的结果。本研究强调了数据高效策略在推进奖励模型优化中的潜力,为低资源 RLHF 应用提供了稳健的解决方案。
引用
@article{arxiv.2506.08965,
title = {GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO},
author = {Yiyang Zhao and Huiyu Bai and Xuejiao Zhao},
journal= {arXiv preprint arXiv:2506.08965},
year = {2025}
}