大语言模型数学推理能力:基于蒙特卡洛自校准树的提升
机器学习
2025-06-03 v2
摘要
数学推理是大语言模型 (LLM) 面临的重要挑战。为提升其能力,我们提出蒙特卡洛自校准树 (MC-NEST),这是一种将 LLM 基于自我完善和自我评估集成到复杂推理任务中以实现更佳决策的蒙特卡洛树搜索扩展方法。MC-NEST 采用上置置信上限 (UCT) 分数结合多样化选择策略,在探索与开发之间取得平衡。通过迭代批判与完善,LLM 学会更战略性地推理。实证结果表明,MC-NEST 采用重要抽样策略可显著提升 GPT-4o 的性能,在奥林匹克水平基准测试中实现最先进的 pass@1 分数。具体而言,MC-NEST 在 AIME 上取得 38.6 的 pass@1,在 MathOdyssey 上取得 12.6 的 pass@1。使用 GPT-4o 和 Phi-3-mini 的 MC-NEST 解决方案质量分别达到 84.0% 和 82.08%,表明其在不同 LLM 之间具有稳健的一致性。MC-NEST 在代数、几何和数论方面表现强劲,得益于其处理抽象、逻辑演绎和多步骤推理能力——这些都是数学问题解决的核心技能。
引用
@article{arxiv.2411.15645,
title = {MC-NEST: Enhancing Mathematical Reasoning in Large Language Models leveraging a Monte Carlo Self-Refine Tree},
author = {Gollam Rabby and Farhana Keya and Sören Auer},
journal= {arXiv preprint arXiv:2411.15645},
year = {2025}
}