互推理使小型语言模型成为更强的解题器
计算与语言
2024-08-13 v1
摘要
本文提出 rStar,一种自博弈互推理方法,在不进行微调或使用更优模型的情况下显著提升了小型语言模型(SLM)的推理能力。rStar 将推理解耦为自博弈互生成-判别过程。首先,目标 SLM 通过丰富的人类推理动作增强蒙特卡洛树搜索(MCTS),以构建更高质量的推理轨迹。接下来,另一个与目标 SLM 能力相似的 SLM 作为判别器,验证目标 SLM 生成的每条轨迹。双方一致的推理轨迹被视为互一致,因此更可能是正确的。在五个 SLM 上的大量实验表明,rStar 能有效解决多种推理问题,包括 GSM8K、GSM-Hard、MATH、SVAMP 和 StrategyQA。值得注意的是,rStar 将 LLaMA2-7B 的 GSM8K 准确率从 12.51% 提升至 63.91%,将 Mistral-7B 的准确率从 36.46% 提升至 81.88%,将 LLaMA3-8B-Instruct 的准确率从 74.53% 提升至 91.13%。代码将在 https://github.com/zhentingqi/rStar 上提供。
引用
@article{arxiv.2408.06195,
title = {Mutual Reasoning Makes Smaller LLMs Stronger Problem-Solvers},
author = {Zhenting Qi and Mingyuan Ma and Jiahang Xu and Li Lyna Zhang and Fan Yang and Mao Yang},
journal= {arXiv preprint arXiv:2408.06195},
year = {2024}
}