中文

RLHF 中人类信念的描述性与规范性理论

人工智能 2025-06-03 v1 机器学习

摘要

RLHF 中的人类偏好通常被建模为人类奖励函数或相应最优状态-动作值的函数。在这项工作中,我们提出人类对受训智能体能力的信念在偏好生成中也起着关键作用。我们考察了与该假设相关的两个问题,分别是描述性和规范性的:人类标注者对智能体能力的信念是否会影响他们提供的偏好?以及对于人类而言,关于智能体的理想信念集——以及由此产生的偏好——是什么?我们提出了一种结合人类信念的新偏好模型,并提供了一种规范性理论,该理论基于人类信念与理想化信念集之间的\textit{失配}界定了最终学习策略的误差。随后,我们通过一项人类研究证实,对智能体能力的信念确实会显著影响偏好,并且可以通过简单的干预加以影响。此外,我们通过合成实验从经验上表明,人类偏好标注者假设智能体具有最优性通常是次优的。总的来说,这些结果从理论和经验上证明了减少人类信念与智能体能力之间的失配如何能够带来性能更优的 RLHF,并为 RLHF 从业者指明了新的最佳实践。

关键词

引用

@article{arxiv.2506.01692,
  title  = {A Descriptive and Normative Theory of Human Beliefs in RLHF},
  author = {Sylee Dandekar and Shripad Deshmukh and Frank Chiu and W. Bradley Knox and Scott Niekum},
  journal= {arXiv preprint arXiv:2506.01692},
  year   = {2025}
}