基于偏好之偏好的自适应边际 RLHF
机器学习
2025-12-02 v3 人工智能
计算与语言
摘要
基于边际的优化是提升分类任务泛化能力和鲁棒性的基础。在基于人类反馈的强化学习(RLHF)中,从偏好学习奖励模型的背景下,现有方法通常依赖于无边际、固定边际或作为偏好评分简单函数的边际。然而,此类公式往往未能考虑到不同偏好的强度差异,例如,某些偏好与响应之间更大的边际相关联,或者它们依赖于从评分中得出的带噪声的边际信息。我们认为,对偏好强度进行建模可以带来更好的泛化能力和更忠实的对齐。此外,许多使用自适应边际的现有方法假设能够获得准确的偏好分数,而这对于人类来说难以可靠地提供。我们提出了一种利用“偏好之上的偏好”的方法,即指示两个偏好中哪一个反映了更强区分的标注。我们利用这种序数信号来推断每个数据点的自适应边际。我们引入了直接偏好优化(DPO)的扩展,DPO-PoP,它结合了来自偏好之上偏好监督的自适应边际,从而提升了判别和生成性能。从经验上看,我们的方法在 UltraFeedback 数据集上优于原始 DPO、使用固定边际的 DPO 以及使用真实边际的 DPO。此外,我们表明判别性能与生成性能之间存在权衡:提高测试分类准确率,特别是以牺牲强偏好为代价正确标记弱偏好,可能导致生成质量下降。为了应对这种权衡,我们提出了两种采样策略来收集偏好之上的偏好标签:一种偏向判别性能,另一种偏向生成性能。
引用
@article{arxiv.2509.22851,
title = {Adaptive Margin RLHF via Preference over Preferences},
author = {Yaswanth Chittepu and Prasann Singhal and Greg Durrett and Scott Niekum},
journal= {arXiv preprint arXiv:2509.22851},
year = {2025}
}