基于蒙特卡洛树搜索增强的数学推理中的步骤级奖励模型:反直觉发现
人工智能
2025-03-11 v3 机器学习
摘要
步骤级奖励模型(SRMs)可通过过程监督或基于强化学习的步骤级偏好对齐来显著提升数学推理性能。SRMs的性能至关重要,因为它们作为关键指导,确保推理过程中的每一步都与所需结果一致。最近,类似AlphaZero的方法,通过对步骤级偏好进行自动注释,证明尤其有效。然而,SRMs成功背后的具体机制仍鲜有探索。为填补这一空白,本研究深入探讨了SRMs的反直觉方面,特别是聚焦于基于MCTS的方法。我们的发现表明,去除思考过程的自然语言描述对SRMs效能的影响甚微。此外,我们展示了SRMs在处理数学语言中复杂逻辑一致性方面相当高效,但在自然语言方面则难以胜任。这些见解提供了对推动有效步骤级奖励建模核心要素的细致理解。通过揭示这些机制,本研究为开发更高效和更简洁的SRMs提供了有价值的指导,这可以通过聚焦于数学推理的关键部分来实现。
引用
@article{arxiv.2412.15904,
title = {What Are Step-Level Reward Models Rewarding? Counterintuitive Findings from MCTS-Boosted Mathematical Reasoning},
author = {Yiran Ma and Zui Chen and Tianqiao Liu and Mi Tian and Zhuo Liu and Zitao Liu and Weiqi Luo},
journal= {arXiv preprint arXiv:2412.15904},
year = {2025}
}
备注
AAAI 2025