中文

ReasonFlux:通过扩展思维模板实现层次化LLM推理

计算与语言 2025-03-12 v2 人工智能 机器学习

摘要

我们提出,基于扩展思维模板的层次化LLM推理能够有效优化推理搜索空间,并超越OpenAI o1-preview和DeepSeek V3等强大LLM的数学推理能力。我们仅用8块GPU训练了ReasonFlux-32B模型,并引入了三项创新:(i)结构化且通用的思维模板库,包含约500个能够泛化到类似或相关推理问题的高层次思维模板;(ii)对一系列思维模板进行层次化强化学习,而非长链思维,优化基础LLM规划最佳模板轨迹以逐步处理复杂问题;(iii)全新的推理扩展系统,使层次化LLM推理能够在推理时自适应扩展思维模板。我们使用的模板轨迹比DeepSeek-R1和o3-mini更具可解释性,ReasonFlux-32B显著提升了数学推理能力至最先进水平。在MATH基准测试中达到91.2%的准确率,超越o1-preview 6.7%。在USA数学锦标赛(AIME)基准测试中,ReasonFlux-32B解决问题平均率达56.7%,超越o1-preview和DeepSeek-V3分别提升了27%和45%。代码:https://github.com/Gen-Verse/ReasonFlux

关键词

引用

@article{arxiv.2502.06772,
  title  = {ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates},
  author = {Ling Yang and Zhaochen Yu and Bin Cui and Mengdi Wang},
  journal= {arXiv preprint arXiv:2502.06772},
  year   = {2025}
}

备注

Code: https://github.com/Gen-Verse/ReasonFlux