LLaMA-Berry:用于O1类奥林匹克数学推理的两两优化
人工智能
2024-11-22 v2 计算与语言
摘要
本文提出了一种先进的数学问题解决框架LLaMA-Berry,用于提高大型语言模型(LLM)的数学推理能力。该框架将蒙特卡洛树搜索(MCTS)与迭代自我润色相结合,以优化推理路径,并利用两两奖励模型对不同路径进行全局评估。通过利用LLM的自我批判和重写能力,应用到MCTS的自我润色(SR-MCTS)克服了传统逐步和贪心搜索算法的效率和局限性,促进了对解空间的更有效探索。基于强化学习从人类反馈(RLHF)的两两偏好奖励模型(PPRM)用于建模解答之间的两两偏好,利用增强巴尔达计数(EBC)方法将这些偏好综合为全局排名分数,以寻找更好的答案。该方法解决了数学推理任务中评分可变性和非独立分布的挑战。在一般和高级基准测试中,该框架在搜索效率和问题解决能力方面优于现有方法,如ToT和rStar,特别是在复杂的奥林匹克级别基准测试中,包括GPQA、AIME24和AMC23。
引用
@article{arxiv.2410.02884,
title = {LLaMA-Berry: Pairwise Optimization for O1-like Olympiad-Level Mathematical Reasoning},
author = {Di Zhang and Jianbo Wu and Jingdi Lei and Tong Che and Jiatong Li and Tong Xie and Xiaoshui Huang and Shufei Zhang and Marco Pavone and Yuqiang Li and Wanli Ouyang and Dongzhan Zhou},
journal= {arXiv preprint arXiv:2410.02884},
year = {2024}
}