中文

通过因果驱动的推理时干预消除奖励模型偏差

计算与语言 2026-05-01 v1 人工智能

摘要

奖励模型(RMs)在使大语言模型(LLMs)与人类偏好对齐中扮演核心角色。然而,奖励模型通常对诸如回复长度等虚假特征敏感。现有的推理时缓解这些偏差的方法通常只关注回复长度,导致性能权衡。在本文中,我们提出了一种因果驱动的干预方法,用于在推理时缓解奖励模型中的多种偏差。我们的方法首先识别其激活与预定义偏差属性强相关的神经元,然后应用神经元级别的干预来抑制这些信号。我们在奖励模型基准上评估了我们的方法,观察到在多种偏差类型上对虚假特征的敏感性降低,且未引起性能权衡。此外,当用于偏好标注时,采用我们方法的小型奖励模型(2B和7B),仅编辑了奖励模型中不到2%的神经元,就能使大语言模型改善对齐效果,在AlpacaEval和MT-Bench上取得了与最先进的70B奖励模型相当的性能。进一步分析表明,偏差信号主要由早期层的神经元编码,这揭示了奖励模型中偏差利用的内部机制。

关键词

引用

@article{arxiv.2604.27495,
  title  = {Debiasing Reward Models via Causally Motivated Inference-Time Intervention},
  author = {Kazutoshi Shinoda and Kosuke Nishida and Kyosuke Nishida},
  journal= {arXiv preprint arXiv:2604.27495},
  year   = {2026}
}

备注

Accepted to ACL 2026 Main Conference