中文

超频LLM推理: 监控与控制LLM思考路径长度

机器学习 2025-06-10 v1 人工智能

摘要

最近,诸如显式结构化推理等技术在强化模型内部"思考"过程与最终响应之间分离方面展现出强大的测试时扩展行为。影响答案质量的关键因素之一是思考阶段的长度。当推理过短时,模型可能未能捕捉任务的复杂性;相反,当其过长时,模型可能产生过度思考,导致不必要的计算并降低性能。本文探索并利用LLM在显式思考过程中理解和调节推理长度的底层机制。首先,我们展示LLM通过推理过程编码其进度,并引入一种交互式进度条可视化,用于揭示模型的规划动态。随后,我们在推理期间操纵内部进度编码,以减少不必要的步骤并生成更简洁果断的思考链。我们的实证结果表明,这种"超频"方法可缓解过度思考,提高答案准确率,同时降低推理延迟。我们的代码已公开。

关键词

引用

@article{arxiv.2506.07240,
  title  = {Overclocking LLM Reasoning: Monitoring and Controlling Thinking Path Lengths in LLMs},
  author = {Roy Eisenstadt and Itamar Zimerman and Lior Wolf},
  journal= {arXiv preprint arXiv:2506.07240},
  year   = {2025}
}