中文

基于PRM引导的树状搜索在数学推理中的极限:使用LLM的案例研究

机器学习 2025-10-24 v1 人工智能

摘要

虽然链式思维提示配合最佳N(BoN)选择在大语言模型(LLM)的数学推理中流行,但其线性结构难以捕捉复杂问题解决中的分支与探索性。本文提出一种自适应算法,以最大化处理奖励模型(PRM)得分来覆盖不可遍历的动作空间,并探讨PRM引导的树状搜索是否能通过探索多个部分解路径来提升数学推理。我们以Qwen2.5-Math-7B-Instruct及其相关PRM为案例研究,在23个多样化数学问题上进行测试,发现:(1)PRM引导的树状搜索在BoN之上未实现统计显著的改进,尽管成本更高;(2)蒙特卡洛树搜索和束搜索均优于其他PRM引导的树状搜索方法;(3)PRM在状态值上的近似较差,其可靠性随推理深度而退化;(4)PRM在跨分布外的泛化能力差。这种表现不佳源于树状搜索更依赖不可靠的PRM得分,表明在树状搜索能够有效提升LLM数学推理之前,仍需不同的奖励建模方法。

关键词

引用

@article{arxiv.2510.20272,
  title  = {Limits of PRM-Guided Tree Search for Mathematical Reasoning with LLMs},
  author = {Tristan Cinquin and Geoff Pleiss and Agustinus Kristiadi},
  journal= {arXiv preprint arXiv:2510.20272},
  year   = {2025}
}