逆向搜索:探索未被采用的路径以实现更深入且更高效的推理
人工智能
2025-04-16 v2 计算与语言
机器学习
摘要
大型推理模型通过长篇幽默的推理轨迹展现出惊人的推理能力。对此类推理轨迹进行监督式微调(即蒸馏)可是提升学生模型推理能力的高性价比方式。然而,经验观察表明,这些推理轨迹往往次优,通过在不同思考路径之间频繁切换,导致浅层思考、过度思考甚至产生退化响应。我们引入逆向搜索(Retro-Search),一种受蒋特森树搜索(MCTS)启发的搜索算法,用于从大型推理模型中提炼出更高质量的推理路径。逆向搜索反馈性地修订推理路径,以发现更短、更优的轨迹,从而可引导学生模型在更短的推理长度下获得增强的推理能力。我们的方案可实现两种用例:自我改进——模型在其自身经逆向搜索修订后的思考轨迹上进行微调;以及弱到强的提升——较弱模型通过逆向搜索修订较强模型的思考轨迹。对于自我改进,R1-distill-7B 在其自身经逆向搜索修订的轨迹上进行微调,平均推理长度缩短31.2%,同时在七个数学基准测试中提升7.7%性能。对于弱到强的提升,我们使用 R1-distill-32B 作为逆向搜索器,对来自 OpenThoughts 数据集的 R1-671B 的轨迹进行反馈性修订(该模型规模仅为其1/20)。以 Qwen2.5-32B 在此精炼后的数据上进行微调,实现与 R1-distill-32B 相当的性能,推理长度缩短11.3%,性能提升2.4%。我们的工作反驳了近期涌现的观点——即在大型推理模型时代,搜索算法的相关性被质疑——通过展示即便是前沿模型仍存在算法性进步的机会。
引用
@article{arxiv.2504.04383,
title = {Retro-Search: Exploring Untaken Paths for Deeper and Efficient Reasoning},
author = {Ximing Lu and Seungju Han and David Acuna and Hyunwoo Kim and Jaehun Jung and Shrimai Prabhumoye and Niklas Muennighoff and Mostofa Patwary and Mohammad Shoeybi and Bryan Catanzaro and Yejin Choi},
journal= {arXiv preprint arXiv:2504.04383},
year = {2025}
}
备注
Code and data will be publicly released upon internal approval