中文

学习相关奖励模型:统计障碍与机遇

机器学习 2026-05-28 v2 计量经济学 机器学习

摘要

随机效用模型(RUM)是建模用户偏好并在强化学习从人类反馈(RLHF)中发挥关键作用的经典框架。然而,这些技术许多的关键短comings 是独立无关替代假设(IIA),该假设将所有人类偏好坍缩为通用底层效用函数,导致对人类偏好范围的粗糙近似。另一方面,避免这一假设的模型在统计和计算保证方面寥寥无几。本文我们研究学习一种\emph{相关}的概率模型,这是一种基本的RUM,旨在避免IIA假设。首先,我们确立了成对偏好数据收集范式是\emph{根本不足以}学习相关信息的,这解释了在这一设置中缺乏统计和计算保证的原因。接下来,我们证明\emph{最佳三选}偏好数据能够克服这些短comings,并设计了一个在统计和计算效率方面都高效的估计器,实现接近最优的性能。这些结果突显了更高阶偏好数据在学习相关效用方面的优势,允许更精细地建模人类偏好。最后,我们在几个真实数据集上验证了这些理论保证,显示出对人类偏好更个性化的建模。

关键词

引用

@article{arxiv.2510.15839,
  title  = {Learning Correlated Reward Models: Statistical Barriers and Opportunities},
  author = {Yeshwanth Cherapanamjeri and Constantinos Daskalakis and Gabriele Farina and Sobhan Mohammadpour},
  journal= {arXiv preprint arXiv:2510.15839},
  year   = {2026}
}

备注

International Conference on Learning Representations (ICLR) 2026