中文

奖励模型识别一致性而非因果性

机器学习 2025-02-21 v1 人工智能 计算与语言

摘要

奖励模型(RM)在与人类偏好一致性大型语言模型(LLM)方面发挥着关键作用,提升推理质量。传统上,RM根据正确性和连贯性对候选输出进行排序。然而,本文发现了若干令人惊讶的发现,挑战了关于RM行为的常见假设。我们的分析表明,领先的奖励模型优先考虑结构一致性而非因果正确性。具体而言,删除问题陈述对奖励分数影响甚微,而改变数值或破坏推理流程则显著影响RM的输出。此外,RM exhibits strong dependence on complete reasoning trajectories, indicating that RMs primarily rely on learned reasoning patterns rather than explicit problem comprehension. 这些发现跨越多种架构、数据集和任务,导致三个关键洞察:(1)RM主要评估连贯性而非真正的推理质量;(2)问题理解在奖励分配中的作用被高估;(3)当前的RM在排序响应方面可能比验证逻辑有效性更有效。我们的结果表明现有奖励建模方法存在根本性局限,强调需要转向因果感知的奖励模型,以超越一致性驱动的评估。

关键词

引用

@article{arxiv.2502.14619,
  title  = {Reward Models Identify Consistency, Not Causality},
  author = {Yuhui Xu and Hanze Dong and Lei Wang and Caiming Xiong and Junnan Li},
  journal= {arXiv preprint arXiv:2502.14619},
  year   = {2025}
}

备注

16 pages