中文

RATE:基于不完美反事实样本的奖励模型因果可解释性

计算与语言 2025-05-21 v3 人工智能

摘要

奖励模型广泛用作对齐或评估 LLM 时的人类偏好代理。然而,奖励模型是黑箱,往往不清楚它们到底在奖励什么。本文发展出基于重写的属性处理估计器(Rewrite-based Attribute Treatment Estimator, RATE),作为测量奖励模型对响应高级属性(如情感、有用性或复杂度)敏感性的有效方法。重要的是,RATE 测量属性对奖励的因果效应。RATE 使用 LLM 对响应进行重写,以产生不完美的反事实样本,用于测量因果效应。一个关键挑战是,这些重写不完美,可能在估计奖励模型对属性的敏感性时引起显著偏差。RATE 的核心思想是通过双重重写来调整此不完美重写效应。我们建立了 RATE 程序的有效性,并通过实证研究表明它是一个有效的估计器。

关键词

引用

@article{arxiv.2410.11348,
  title  = {RATE: Causal Explainability of Reward Models with Imperfect Counterfactuals},
  author = {David Reber and Sean Richardson and Todd Nief and Cristina Garbacea and Victor Veitch},
  journal= {arXiv preprint arXiv:2410.11348},
  year   = {2025}
}

备注

ICML 2025. Code at https://github.com/toddnief/RATE