中文

LLM是否真的需要10+个思考步骤来寻找1000天后的时间?——关于LLM过度思考的结构性理解

计算与语言 2025-10-14 v2

摘要

采用长链式思维(CoT)推理的模型在复杂推理任务中显示出优异性能。然而,这一能力引入了一个关键且常被忽视的效率问题——过度思考。模型常常对简单查询进行不必要的广泛推理,却没有 accuracy improvements。虽然已有工作探索了缓解过度思考的解决方案,但其根本原因仍缺乏深入理解。大多数现有分析仅限于浅显的、基于剖析的观察,未能深入探讨LLM的内部工作机制。本 study introduces a systematic, fine-grained analyzer of LLMs' thought process to bridge the gap, TRACE. 我们首先对 overthinking 问题进行基准测试,确认长时间思考的模型在简单任务上慢5至20倍且无显著提升。随后,我们使用 TRACE 首先将思考过程分解为最小完整子思考,然后通过推断子思考之间的论述关系,构建细粒度的思考进展图谱,并识别出与主题相似查询的常见思考模式。我们的分析揭示了开放权重思考模型的两种主要模式——探索者(Explorer)和迟到抵达(Late Landing)。这一发现表明,过度验证和过度探索是 LLM 过度思考的主要驱动因素。基于思考结构,我们提出一种基于效用的方法定义 overthinking,这超越了基于长度的指标。这一修订后的定义提供了对 LLM 思考进程的更深刻理解,以及原则性管理 overthinking 的实用指南。

关键词

引用

@article{arxiv.2510.07880,
  title  = {Do LLMs Really Need 10+ Thoughts for "Find the Time 1000 Days Later"? Towards Structural Understanding of LLM Overthinking},
  author = {Xinliang Frederick Zhang and Anhad Mohananey and Alexandra Chronopoulou and Pinelopi Papalampidi and Somit Gupta and Tsendsuren Munkhdalai and Lu Wang and Shyam Upadhyay},
  journal= {arXiv preprint arXiv:2510.07880},
  year   = {2025}
}

备注

30 pages, 41 figures, 10 tables. Preprint