中文

有限推理空间:大语言模型中长程推理的限制

人工智能 2026-03-13 v2

摘要

测试时计算策略,如链式思维(Chain-of-Thought, CoT),显著增强了大型语言模型解决复杂任务(如逻辑推理)的能力。然而,实证研究表明,仅增加计算预算在采用典型任务分解策略(如CoT)时,可能会导致测试时性能恶化。本文假设,随计算预算增大的推理失败源于静态规划方法,这些方法几乎感知不到大语言模型推理的内在边界。我们称之为有限推理空间假设(Limited Reasoning Space hypothesis),并通过非自主随机动力系统的视角进行理论分析。这一洞见表明,计算预算存在最佳范围;过度规划可能导致冗余反馈,甚至损害推理能力。为利用计算扩缩优势并抑制过度规划,本文提出了Halo——一种用于LLM规划的模型预测控制框架。Halo设计用于具有基于推理的规划的长程任务,构建了一个基于熵的双控制器,采用度量后规划(Measure-then-Plan)策略以实现可控推理。实验结果表明,在动态调节推理边界方面,Halo在复杂长程任务上优于静态基线。

关键词

引用

@article{arxiv.2602.19281,
  title  = {Limited Reasoning Space: The cage of long-horizon reasoning in LLMs},
  author = {Zhenyu Li and Guanlin Wu and Cheems Wang and Yongqiang Zhao},
  journal= {arXiv preprint arXiv:2602.19281},
  year   = {2026}
}