探索-执行链:高效结构化推理范式
机器学习
2025-10-01 v2 人工智能
计算与语言
机器学习
摘要
链式思维(CoT)及其变体已显著提升了大型语言模型(LLM)的推理能力,但其单一且自回归的体系结构本质上将高层战略规划与低层逐步执行混合在一起,导致计算效率低下、推理路径探索受限且可解释性下降。为克服这些问题,我们提出探索-执行链(),一种结构化推理框架,将推理解耦为两个 distinct 阶段:一个随机生成简洁高层计划的探索阶段,随后是一个确定性地执行所选计划的执行阶段。我们的方法包含两种训练方法:结合受监督微调(SFT)——增强由新颖数据生成算法 enforcing strict plan adherence 的 SFT ——以及随后的强化学习(RL)阶段,后者利用探索的 informative 性并强化执行的确定性。这种分解使我们能够实现高效的测试时扩展策略:在 AIME'2024 上, 测试时扩展精度达 58.1%,仅使用相当于其他方法(如 Forest-of-Thought)的 <10% 解码标记,显著削减了自洽开销。在跨域适应方面,我们的探索-聚焦 SFT(EF-SFT)仅使用标准 SFT 的 3.5% 标记即可进行微调,但在医学基准测试中比标准 SFT 高出最高 14.5%,实现了最先进的性能、强大的泛化能力和更好的可解释性,通过将规划与执行分离来实现。该项目的代码和预训练模型均可用:https://github.com/yks23/Explore-Execute-Chain.git
引用
@article{arxiv.2509.23946,
title = {Explore-Execute Chain: Towards an Efficient Structured Reasoning Paradigm},
author = {Kaisen Yang and Lixuan He and Rushi Shah and Kaicheng Yang and Qinwei Ma and Dianbo Liu and Alex Lamb},
journal= {arXiv preprint arXiv:2509.23946},
year = {2025}
}