修复破损指南针:诊断与改进推理时奖励建模
计算与语言
2026-02-12 v2 人工智能
摘要
推理时扩展技术在增强大语言模型(LLM)的推理能力方面展现出前景。虽然近期研究主要聚焦于训练时优化,但我们的工作强调了基于推理时奖励模型(RM)的推理是一个关键但被忽视的方向。在本文中,我们对 RM 在下游推理任务中的行为进行了系统分析,揭示了三个关键局限:(1)RM 可能损害简单问题的性能;(2)其判别能力随采样增加而下降;(3)高搜索多样性会削弱 RM 性能。为解决这些问题,我们提出了 CRISP(Clustered Reward Integration with Stepwise Prefixing),一种新颖的推理时算法,它将生成的推理路径按最终答案进行聚类,在聚类层面聚合奖励信号,并自适应地更新前缀提示以引导生成。实验结果表明,CRISP 显著增强了 LLM 的推理性能,相比其他基于 RM 的推理方法实现了高达 5% 的准确率提升,相比先进推理模型实现了平均 10% 的增益。
引用
@article{arxiv.2503.05188,
title = {Fixing the Broken Compass: Diagnosing and Improving Inference-Time Reward Modeling},
author = {Jiachun Li and Pengfei Cao and Zhuoran Jin and Yubo Chen and Jiexin Xu and Huaijun Li and Xiaojian Jiang and Kang Liu and Jun Zhao},
journal= {arXiv preprint arXiv:2503.05188},
year = {2026}
}
备注
38 pages, 30 figures, Accpeted by ICLR 2026