中文

前规划赋能的 LLM 数学推理:认识何为题再思考如何解

计算与语言 2026-05-29 v1

摘要

当前基于计划的推理方法通过在执行前插入规划阶段来提升大语言模型(LLM)的表现,形成问题 \rightarrow 计划 \rightarrow 思考链范式。虽然有效,但更深入的审视揭示了固有的范式级差距:规划及其执行阶段均决定如何解题,而关于解题类型的识别、适用工具以及可预见的陷阱等问题,却完全潜在地存在。为弥合这一差距,我们提出 PPC(Preplan-Plan-CoT),一个引入显式问题理解阶段的框架,即前规划,形成新的问题 \rightarrow 前规划 \rightarrow 计划 \rightarrow 思考链范式。实现此范式需要在两个端点确保前规划的概念完整性。具体而言,我们设计了三阶段合成管道,配合剥夺评分器筛选泄漏和剥夺失效,构建干净的前规划监督数据;并引入复合 GRPO 奖励,确保生成的计划真正源于前规划。实验在四个 backbone 和五个数学推理基准上表明,PPC 在 39 个 40 个指标上实现最佳效果,相较最强基线提升 maj@16 和 pass@16分别为 +2.23 和 +3.06,且未引入额外的推理 token 开销。

关键词

引用

@article{arxiv.2605.30245,
  title  = {Knowing What to Solve Before How: Preplan Empowered LLM Mathematical Reasoning},
  author = {Shaojie Wang and Liang Zhang},
  journal= {arXiv preprint arXiv:2605.30245},
  year   = {2026}
}