ResponseRank:基于偏好强度学习的数据高效奖励建模
机器学习
2026-01-01 v1
摘要
二元选择(如常用于强化学习人类反馈(RLHF))仅传递偏好方向。人们可能选择苹果而非橙子和香蕉而非葡萄,但哪种偏好更强?在不确定情境下做出决策和偏好模型的泛化,强度至关重要,但可靠测量困难。元数据如响应时间和注释者间一致性可作为强度的代理,但常受噪声和混杂影响。我们提出 ResponseRank 以解决从噪声强度信号学习的挑战。该方法利用代理信号的相对差异,对来自两两比较的响应按其推断偏好强度进行排序。通过在严格构建的分层中仅进行局部比较来控制系统性变异。这实现了鲁棒的效用差学习,符合强度派生的排序,同时对强度信号的假设最小。我们的贡献有三方面:(1)ResponseRank—a novel method that robustly learns preference strength by leveraging locally valid relative strength signals;(2)合成偏好学习(带模拟响应时间)、语言模型(带注释者一致性)和 RL 控制任务(带模拟回合收益)等多样化任务中样本效率和鲁棒性的实证证据;(3)Pearson Distance Correlation(PDC)——一种新颖指标,隔离卡诺效用学习与序数准确性。
引用
@article{arxiv.2512.25023,
title = {ResponseRank: Data-Efficient Reward Modeling through Preference Strength Learning},
author = {Timo Kaufmann and Yannick Metz and Daniel Keim and Eyke Hüllermeier},
journal= {arXiv preprint arXiv:2512.25023},
year = {2026}
}
备注
NeurIPS 2025