ASTRO:教会语言模型通过反思与回溯进行推理
人工智能
2025-07-02 v1 计算与语言
摘要
我们介绍ASTRO,即“Autoregressive Search-Taught Reasoner”(自回归搜索教学推理器),这是一个训练语言模型以搜索算法方式进行推理的框架,显式利用自我反思、回溯和探索。最近,通过强化学习(RL)训练大型语言模型(LLM)导致推理模型能力大幅提升。开源推理模型虽然成功了,但建立在已经表现出强大推理能力以及即使在RL之前就能观察到搜索行为的模型之上。因此,尚不清楚如何提升其他非推理模型(包括Llama 3)的推理能力。ASTRO通过从蒙特卡洛树搜索(MCTS) over数学问题解决轨迹派生的合成数据集,教导此类模型内化结构化的搜索行为。通过将搜索痕迹转换为捕获成功与失败恢复的自然语言链式思维,ASTRO在RL中为探索提供丰富的先验知识。我们对这些搜索派生的轨迹进行微调,并通过可验证奖励进一步提升性能。我们将ASTRO应用于Llama 3系列模型,在MATH-500上实现16.0%的绝对性能提升,在AMC 2023上实现26.9%的提升,在AIME 2024上实现20.0%的提升,尤其改进了需要迭代纠正的具有挑战性的问题。我们的结果表明,搜索启发的训练为开源LLM注入稳健的推理能力提供了原则方法。
引用
@article{arxiv.2507.00417,
title = {ASTRO: Teaching Language Models to Reason by Reflecting and Backtracking In-Context},
author = {Joongwon Kim and Anirudh Goyal and Liang Tan and Hannaneh Hajishirzi and Srinivasan Iyer and Tianlu Wang},
journal= {arXiv preprint arXiv:2507.00417},
year = {2025}
}
备注
36 pages, 23 figures