链路思考推理是否是幻象?一种数据分布视角
人工智能
2026-05-12 v6 计算与语言
机器学习
摘要
链路思考 (CoT) 提示方式已被证明在从大型语言模型 (LLMs) 中激发结构化推理 (即 CoT 推理) 时非常有效。尽管其流行,但近期研究揭示了其在某些推理任务中的失败,引发了关于 CoT 推理本质的根本性质疑。本文提出一种数据分布视角来理解 CoT 推理何时为何成功或失败。我们假设 CoT 推理是从分布于训练数据中的结构化归纳偏见中学习到的,使模型能够在条件化生成推理轨迹,以近似训练期间观察到的轨迹。因此,CoT 推理的有效性根本取决于训练数据与测试查询之间分布差异的性质与程度。在此视角指导下,我们通过三个维度解构 CoT 推理:任务、长度和格式。为测试该假设,我们引入 DataAlchemy,一个抽象且完全可控的环境,用于从头训练 LLMs 并在各种分布条件下进行系统性探测。通过严格的受控实验,我们揭示了在被推动超出训练分布时,CoT 推理是一种脆弱的幻象,从而凸显了实现真正且可泛化推理的持续挑战。
引用
@article{arxiv.2508.01191,
title = {Is Chain-of-Thought Reasoning of LLMs a Mirage? A Data Distribution Lens},
author = {Chengshuai Zhao and Zhen Tan and Pingchuan Ma and Dawei Li and Bohan Jiang and Yancheng Wang and Yingzhen Yang and Huan Liu},
journal= {arXiv preprint arXiv:2508.01191},
year = {2026}
}
备注
Accepted by the Association for Computational Linguistics (ACL) 2026 and Foundations of Reasoning in Language Models (FoRLM) at NeurIPS 2025