中文

通过因果准则实现鲁棒的奖励建模

机器学习 2025-06-23 v1

摘要

奖励模型(RMs)是通过人类反馈对齐大型语言模型(LLMs)的基础,但它们常常遭受奖励黑客攻击。它们倾向于抓住表面或虚假的属性,如响应长度或格式,将这些从训练数据相关性中学到的线索误认为是质量的真正因果驱动因素(例如,事实性、相关性)。这是因为标准训练目标难以解耦这些因素,导致脆弱的RM和错位的策略。我们引入了Crome(因果鲁棒奖励建模),这是一个基于显式因果模型的新框架,旨在缓解奖励黑客攻击。Crome在训练期间采用以下合成目标增强:(1) 因果增强,即沿特定因果属性不同的配对,以强制对每个因果属性单独敏感,以及(2) 中性增强,即主要在虚假属性上变化的平局标签配对,以强制对虚假属性不变性。值得注意的是,我们的增强是在没有任何虚假因素知识的情况下产生的,仅通过沿因果准则的答案干预,这些准则由查询一个预言机LLM识别。实验上,Crome在RewardBench上显著优于标准基线,平均准确率提高了高达5.4%,并在特定类别中实现了高达13.2%和7.2%的提升。Crome的鲁棒性进一步通过在Best-of-N推理设置中随N增加而获得的持续增益得到证实,这些增益跨越各种基准,包括流行的RewardBench(涵盖聊天、聊天困难、安全性和推理任务)、专注于安全的WildGuardTest以及推理特定的GSM8k。

关键词

引用

@article{arxiv.2506.16507,
  title  = {Robust Reward Modeling via Causal Rubrics},
  author = {Pragya Srivastava and Harman Singh and Rahul Madhavan and Gandharv Patil and Sravanti Addepalli and Arun Suggala and Rengarajan Aravamudhan and Soumya Sharma and Anirban Laha and Aravindan Raghuveer and Karthikeyan Shanmugam and Doina Precup},
  journal= {arXiv preprint arXiv:2506.16507},
  year   = {2025}
}