中文

被奖励误导:LLM 中社会不良偏好

计算与语言 2026-05-07 v1 人工智能 计算机与社会

摘要

奖励模型是大语言模型对齐的关键组成部分,在训练期间作为人类偏好的代理。然而,现有的评估主要侧重于广泛的指令遵循基准,对于这些模型是否捕捉了社会期望的偏好提供的洞察有限。因此,社会对齐中的重要失败可能会被隐藏。我们将奖励模型基准测试扩展到四个具有社会后果的领域:偏见、安全、道德和伦理推理。我们引入了一个框架,将社会评估数据集转换为成对偏好数据,在可用时利用黄金标签,否则利用方向性偏差指标。这使我们能够测试奖励模型是否偏好社会不良响应,以及它们的偏好是否在选定输出上产生系统性偏差分布。在五个公开可用的奖励模型和两个用作奖励代理的指令微调模型上,我们发现各领域存在显著差异,没有单一模型在所有方面表现最佳。这些模型远未达到强大的社会智能:它们经常偏好社会不良选项,且其偏好会产生系统性偏差分布。此外,更强的规避偏差会降低对上下文的敏感性,揭示了避免偏差结果与保持上下文忠实性之间的关键对权衡。这些发现表明,标准奖励基准不足以评估社会对齐,并强调需要进行直接测量奖励模型中编码的社会偏好的评估。

关键词

引用

@article{arxiv.2605.05003,
  title  = {Misaligned by Reward: Socially Undesirable Preferences in LLMs},
  author = {Gayane Ghazaryan and Esra Dönmez},
  journal= {arXiv preprint arXiv:2605.05003},
  year   = {2026}
}

备注

Preprint