通过蒙特卡洛树自我完善访问 GPT-4 水平的数学竞赛解答:LLaMa-3 8B
人工智能
2024-06-14 v2
摘要
本文引入 MCT Self-Refine (MCTSr) 算法,这是一种将大型语言模型(LLMs)与蒙特卡洛树搜索(MCTS)集成的创新方法,旨在增强在复杂数学推理任务中的性能。针对 LLMs 在准确性和可靠性方面的挑战,尤其是在战略和数学推理方面,MCTSr 利用系统性探索和启发式自我完善机制来改进 LLMs 内的决策框架。该算法通过迭代的选择、自我完善、自我评估和反向传播过程构建蒙特卡洛搜索树,采用改进的上置置信界(UCB)公式以优化探索-开发平衡。广泛的实验表明,MCTSr 在解决奥林匹克级数学问题方面具有效能,显著提升了在多个数据集上的成功率,包括 GSM8K、GSM Hard、MATH 以及奥林匹克级基准,包括 Math Odyssey、AIME 和 OlympiadBench。该研究推进了 LLMs 在复杂推理任务中的应用,为未来 AI 集成奠定了基础,增强了 LLM 驱动应用中决策的准确性和可靠性。
引用
@article{arxiv.2406.07394,
title = {Accessing GPT-4 level Mathematical Olympiad Solutions via Monte Carlo Tree Self-refine with LLaMa-3 8B},
author = {Di Zhang and Xiaoshui Huang and Dongzhan Zhou and Yuqiang Li and Wanli Ouyang},
journal= {arXiv preprint arXiv:2406.07394},
year = {2024}
}