中文

通过改变理性来缓解 RLHF 中的认知偏差

人工智能 2026-05-11 v1

摘要

我们如何使模型对甚至不完美的人类反馈也具有鲁棒性?在基于人类反馈的强化学习(RLHF)中,人类对模型输出的偏好被用于训练一个奖励模型,该模型为响应分配标量值。由于这些奖励是从成对比较中推断出来的,这种学习依赖于潜在奖励差异与观察到的偏好之间的假设关系,通常使用 Boltzmann 公式建模,其中理性参数 beta 决定了偏好反映奖励差异的一致程度。在实践中,beta 通常被视为反映假设的统一标注者可靠性的固定常数。然而,在实践中人类反馈并非如此简单:真实的人类判断受认知偏差影响,导致在特定情境下出现偏离奖励一致行为的系统性偏差。为了解决这个问题,我们将理性视为依赖于上下文和标注。我们设计了一种方法,在奖励学习期间使用 LLM-as-judge 评估认知偏差的可能存在,从而动态调整理性参数 beta。该方法有效地降低了可能反映有偏差或不可靠判断的比较的权重。在经验上,我们表明即使在具有强烈偏差偏好的数据集上进行微调,该方法也能学习到更理性的下游模型。

关键词

引用

@article{arxiv.2605.06895,
  title  = {Mitigating Cognitive Bias in RLHF by Altering Rationality},
  author = {Tiffany Horter and Andrew Markham and Niki Trigoni and Serena Booth},
  journal= {arXiv preprint arXiv:2605.06895},
  year   = {2026}
}