从 LLM 推理痕迹中提取搜索树揭示仔�规划
人工智能
2026-05-25 v5
摘要
大型语言模型(LLMs),尤其是推理模型,生成的扩展链律(CoT)推理常包含对未来结果的显式 deliberation。然而,这种 deliberation 是否构成真正的规划、其结构如何以及哪些方面驱动性能,仍不为人所理解。在本工作中,我们引入一种新方法,通过从四子棋棋局的推理痕迹中提取并量化搜索树来特征化 LLM 的规划。通过对提取的搜索树拟合计算模型,我们刻画了计划如何结构化以及其如何影响落子决策。我们发现 LLM 的搜索深度不如人类,且性能由搜索宽度而非深度预测。最令人惊讶的是,尽管 LLM 在其痕迹中展开深层节点,但其落子选择最佳地由仔�模型解释,该模型完全忽略这些深层节点。通过对 CoT 段落进行选择性修剪的因果干预研究进一步表明,落子选择主要由浅层节点驱动,而非深层节点。这些模式与人类规划形成鲜明对比,后者的性能主要由深层搜索驱动。总体而言,我们的发现揭示了 LLM 与人类规划之间的关键差异:尽管人类专长由更深的搜索驱动,LLM 却不依赖深层前瞻。这一解耦为对齐 LLM 与人类规划提供了针对性指导。更广泛地说,我们的框架为在更广泛的策略领域中解释 LLM 规划结构提供了通用方法。
引用
@article{arxiv.2605.06840,
title = {Extracting Search Trees from LLM Reasoning Traces Reveals Myopic Planning},
author = {Sixing Chen and Ji-An Li and Saner Cakir and Sinan Akcali and Kayla Lee and Marcelo G. Mattar},
journal= {arXiv preprint arXiv:2605.06840},
year = {2026}
}