MindStar:在推理时增强预训练大型语言模型的数学推理能力
机器学习
2024-06-27 v4
摘要
尽管大型语言模型(LLM)在各种任务中取得了显著性能,但它们通常在复杂推理任务(例如回答数学问题)上表现不佳。最近解决这一问题的努力主要集中在利用数学数据集进行监督微调或自我改进技术。然而,这些方法通常依赖于难以准备的高质量数据集,或者需要大量的计算资源进行微调。受 LLM 知道如何产生正确答案但难以选择正确推理路径这一发现的启发,我们提出了一种纯基于推理的搜索方法——MindStar(M*)。该方法将推理任务形式化为搜索问题,并提出了两种搜索思想来识别最优推理路径。我们在 GSM8K 和 MATH 数据集上评估了 M* 框架,并将其性能与现有的开源和闭源 LLM 进行了比较。我们的结果表明,M* 显著增强了开源模型(如 Llama-2-13B 和 Mistral-7B)的推理能力,并实现了与 GPT-3.5 和 Grok-1 相当的性能,但模型大小和计算成本大幅降低。
引用
@article{arxiv.2405.16265,
title = {MindStar: Enhancing Math Reasoning in Pre-trained LLMs at Inference Time},
author = {Jikun Kang and Xin Zhe Li and Xi Chen and Amirreza Kazemi and Qianyi Sun and Boxing Chen and Dong Li and Xu He and Quan He and Feng Wen and Jianye Hao and Jun Yao},
journal= {arXiv preprint arXiv:2405.16265},
year = {2024}
}