中文

CausalRM:基于观察性用户反馈的因果理论奖励建模

机器学习 2026-03-20 v1 人工智能 计算与语言 机器学习

摘要

尽管强化学习从人类反馈(RLHF)在对齐语言模型方面取得了成功,但当前的奖励建模严重依赖于在受控且成本高昂的条件下收集的人类标注反馈。本文引入了基于观察性用户反馈的奖励建模——即使用观察性用户反馈(如点击、复制和点赞)来学习奖励模型——作为一种可扩展且成本效益更好的替代方案。我们确定了这一情境下的两个根本性挑战:(1)观察性反馈因标注错误而呈现噪声,导致其偏离真实的用户偏好;(2)观察性反馈因用户偏好而产生偏差,用户倾向于对他们认为非常重要的响应提供反馈,这在训练和推断数据之间造成分布迁移。为解决这些挑战,我们提出了 CausalRM,一个基于因果理论的奖励建模框架,旨在从观察性反馈中学习无偏差的奖励模型。为解决挑战(1),CausalRM 引入了一个噪声感知的代理损失项,该损失在无噪声条件下可证明等价于原始损失,通过显式建模标注错误生成过程。为解决挑战(2),CausalRM 使用倾向得分——即用户为给定响应提供反馈的概率——对训练样本进行重新加权,从而产生消除用户偏好偏差的损失函数。广泛的实验在多样化的 LLM 主干模型和基准数据集上验证了 CausalRM 能够从噪声和偏差的观察性反馈中有效学习准确的奖励信号,并在下游 RLHF 任务中实现显著的性能提升——包括在WildGuardMix 上实现 49.2% 的提升,在 HarmBench 上实现 32.7% 的改进。代码已在项目网站上提供。

关键词

引用

@article{arxiv.2603.18736,
  title  = {CausalRM: Causal-Theoretic Reward Modeling for RLHF from Observational User Feedbacks},
  author = {Hao Wang and Licheng Pan and Zhichao Chen and Chunyuan Zheng and Zhixuan Chu and Xiaoxi Li and Yuan Lu and Xinggao Liu and Haoxuan Li and Zhouchen Lin},
  journal= {arXiv preprint arXiv:2603.18736},
  year   = {2026}
}