当数量变多:理解大语言模型中的链式思维长度
人工智能
2025-05-28 v3 计算与语言
机器学习
摘要
大型语言模型(LLMs)采用链式思维(Chain-of-Thought, CoT)推理以分解复杂问题。虽然较长的 CoT 常被假设为更优秀,但本文挑战了这种观念,认为长度并非永远是关键。我们基于来自真实世界观察、受控实验和理论分析的综合证据,展示任务准确率通常随着 CoT 长度呈倒 U 形曲线——即随着 CoT 步骤数量的增加,性能首先提高但最终下降。通过受控实验,我们进一步揭示了最优 CoT 长度的尺度行为:其增长程度随任务难度增加,但随模型能力提升而减小,暴露了一种内在的简单性偏差,即更强大的模型更倾向于采用更短、更高效的 CoT 推理。这种偏差也体现在强化学习(RL)训练中,模型在准确率提高后会倾向于更短的 CoT。为了深入理解这些动态,我们建立了一个简单的理论模型,形式性地证明了这些现象,包括最优长度的尺度规律以及在 RL 中简单性偏差的出现。基于本框架,我们展示了通过采用最优长度的 CoT 进行训练以及在推理时采用长度感知的过滤,能够实现显著的实际收益。这些发现为对“过度思考”现象提供了原则性的理解,并为 CoT 校准提供了多项实用指南,使 LLMs 能够实现针对任务复杂度和模型能力的自适应 CoT,以实现最佳推理性能。
引用
@article{arxiv.2502.07266,
title = {When More is Less: Understanding Chain-of-Thought Length in LLMs},
author = {Yuyang Wu and Yifei Wang and Ziyu Ye and Tianqi Du and Stefanie Jegelka and Yisen Wang},
journal= {arXiv preprint arXiv:2502.07266},
year = {2025}
}