中文

从静态到动态:用于数学过程监督的自适应蒙特卡洛搜索

人工智能 2025-09-30 v1

摘要

过程数据的质量在训练过程奖励模型(PRM)方面起着关键作用,PRM 可以增强大语言模型的复杂数学推理能力。现有方法基于固定预算采样策略估计推理步骤的质量,并在自动化数据生成过程中导航庞大的搜索空间以执行路径扩展,导致其效率低下且缺乏灵活性。为了解决这些问题,我们提出了自适应蒙特卡洛搜索(AMCS),一个将数据生成从固定、静态转变为在节点值估计和路径扩展层面自适应、动态搜索的框架。一方面,AMCS 通过为不确定性更高的推理步骤分配更多样本、为更容易估计的步骤分配更少样本来自适应地优化估计。另一方面,它通过一种时间自适应策略增强路径扩展,该策略从广泛探索开始,逐渐转向利用最有希望的方向。通过 AMCS,我们构建了一个大规模数据集 MathSearch-200K,包含约 200K 个过程监督示例用于训练 PRM。为了验证我们方法的有效性,我们在四个数学推理基准上进行了广泛的实验。实验结果表明,Qwen2.5-Math-7B-PRM-AMCS 在 MATH500 上使用 GLM-4-9B 达到了高达 76.2% 的准确率,超越了所有基线 PRM。值得注意的是,由 Qwen2.5-Math-7B-PRM-AMCS 监督的 7B 模型超越了使用较弱监督的 72B 模型。此外,Qwen2.5-Math-7B-PRM-AMCS 在分布外问题上保持一致优势,展现出强大的泛化能力。我们的代码可在 https://github.com/reml-group/AMCS 获取。

关键词

引用

@article{arxiv.2509.24351,
  title  = {From Static to Dynamic: Adaptive Monte Carlo Search for Mathematical Process Supervision},
  author = {Jie Ma and Shihao Qi and Rui Xing and Ziang Yin and Bifan Wei and Jun Liu and Tongliang Liu},
  journal= {arXiv preprint arXiv:2509.24351},
  year   = {2025}
}