奖励模型识别一致性而非因果性
机器学习
2025-02-21 v1 人工智能
计算与语言
摘要
奖励模型(RM)在与人类偏好一致性大型语言模型(LLM)方面发挥着关键作用,提升推理质量。传统上,RM根据正确性和连贯性对候选输出进行排序。然而,本文发现了若干令人惊讶的发现,挑战了关于RM行为的常见假设。我们的分析表明,领先的奖励模型优先考虑结构一致性而非因果正确性。具体而言,删除问题陈述对奖励分数影响甚微,而改变数值或破坏推理流程则显著影响RM的输出。此外,RM exhibits strong dependence on complete reasoning trajectories, indicating that RMs primarily rely on learned reasoning patterns rather than explicit problem comprehension. 这些发现跨越多种架构、数据集和任务,导致三个关键洞察:(1)RM主要评估连贯性而非真正的推理质量;(2)问题理解在奖励分配中的作用被高估;(3)当前的RM在排序响应方面可能比验证逻辑有效性更有效。我们的结果表明现有奖励建模方法存在根本性局限,强调需要转向因果感知的奖励模型,以超越一致性驱动的评估。
引用
@article{arxiv.2502.14619,
title = {Reward Models Identify Consistency, Not Causality},
author = {Yuhui Xu and Hanze Dong and Lei Wang and Caiming Xiong and Junnan Li},
journal= {arXiv preprint arXiv:2502.14619},
year = {2025}
}
备注
16 pages