中文

智能体思考得更深吗?顺序规划中层间动力学的机制性研究

人工智能 2026-05-28 v1

摘要

近期的机制性研究表明,大型语言模型(LLM)在标准的单轮任务中可能未能高效利用其深度。在自主智能体场景中(模型必须执行多轮规划、工具使用和迭代状态更新),这种情况是否仍然成立尚不清楚。我们通过系统性地分析跨越三个领域(深度研究、代码生成和表格处理)的完整用户-智能体轨迹的层间动力学来研究这个问题。利用残差流探针、因果跳层干预和有效深度测量,我们表明智能体推理展现出与静态任务不同的深度分布特征。随着轨迹展开,模型逐步招募更多且更深的层,在后续轮次中出现更强的长距离层间依赖关系。同时,残差更新变得越来越以修正为主导,表明从稳定的特征积累转向重复的重新校准。有效深度分析进一步揭示了一个显著的构建-精炼差距:语义方向通常相对较早形成,而深层对于稳定最终输出仍然是必要的。在不同模型家族中,这一差距在Qwen和Minimax中尤为明显,而GLM则表现出更依赖领域的深度分配模式。这些结果提供了机制性证据,表明自主LLM智能体会随着推理复杂性的增长而自适应地分配深度。

关键词

引用

@article{arxiv.2605.27935,
  title  = {Do Agents Think Deeper? A Mechanistic Investigation of Layer-Wise Dynamics in Sequential Planning},
  author = {Zhenyu Cui and Xiangzhong Luo},
  journal= {arXiv preprint arXiv:2605.27935},
  year   = {2026}
}