PILAF:面向奖励建模的最优人类偏好采样
机器学习
2025-02-07 v1 机器学习
摘要
随着大语言模型日益驱动现实世界的应用,使其与人类价值观对齐变得至关重要。基于人类反馈的强化学习(RLHF)已成为一项关键技术,在无法获取理想人类价值观的情况下,将偏好数据转化为奖励模型。在实践中,RLHF 主要依赖近似的奖励模型,这些模型可能无法始终如一地引导策略最大化潜在的人类价值观。我们提出了策略插值对齐反馈学习(PILAF),这是一种用于偏好标注的新型响应采样策略,它明确地将偏好学习与最大化潜在理想奖励对齐。PILAF 具有坚实的理论基础,从优化和统计两个角度均证明了其最优性。该方法实现简单,并在反馈筛选至关重要的迭代和在线 RLHF 设置中展现出强大的性能。
引用
@article{arxiv.2502.04270,
title = {PILAF: Optimal Human Preference Sampling for Reward Modeling},
author = {Yunzhen Feng and Ariel Kwiatkowski and Kunhao Zheng and Julia Kempe and Yaqi Duan},
journal= {arXiv preprint arXiv:2502.04270},
year = {2025}
}