超频LLM推理: 监控与控制LLM思考路径长度
机器学习
2025-06-10 v1 人工智能
摘要
最近,诸如显式结构化推理等技术在强化模型内部"思考"过程与最终响应之间分离方面展现出强大的测试时扩展行为。影响答案质量的关键因素之一是思考阶段的长度。当推理过短时,模型可能未能捕捉任务的复杂性;相反,当其过长时,模型可能产生过度思考,导致不必要的计算并降低性能。本文探索并利用LLM在显式思考过程中理解和调节推理长度的底层机制。首先,我们展示LLM通过推理过程编码其进度,并引入一种交互式进度条可视化,用于揭示模型的规划动态。随后,我们在推理期间操纵内部进度编码,以减少不必要的步骤并生成更简洁果断的思考链。我们的实证结果表明,这种"超频"方法可缓解过度思考,提高答案准确率,同时降低推理延迟。我们的代码已公开。
引用
@article{arxiv.2506.07240,
title = {Overclocking LLM Reasoning: Monitoring and Controlling Thinking Path Lengths in LLMs},
author = {Roy Eisenstadt and Itamar Zimerman and Lior Wolf},
journal= {arXiv preprint arXiv:2506.07240},
year = {2025}
}