LLM 是单线程推理者:解构软思维工作机制
计算与语言
2025-10-17 v4 人工智能
摘要
人类认知自然地与抽象且流动的概念交互,而现有推理模型往往依赖生成离散 token,可能限制了其表达能力。近期研究旨在通过使大语言模型(LLM)生成软、抽象 token,以实现连续概念空间内的推理。本文通过一套系统化的探测技术,对各类 LLM 的软思维能力进行分析。与普遍认为软思维支持对多样化推理路径进行并行探索的观点相反,我们的发现表明,LLM 实际上是单线程推理者——它们主要依赖软输入中概率最高的 token 来预测下一步。这种行为会引发贪心反馈回路,抑制替代性推理路径,削弱了通过软 token 传递更丰富信息的潜在优势。为解决此贪心陷阱,我们提出了随机软思维(Stochastic Soft Thinking),通过引入随机性打破贪心循环。实验表明, incorporating randomness——尤其是采用 Gumbel-Softmax 技巧——可缓解基础方法的局限性,释放软思维的潜能,在八项推理基准测试中实现优异性能。我们进一步展示,随机软思维在探索潜能方面优于传统思维链(COT)。我们的发现深化了对连续推理的理解,为未来在强化学习中改进软思维奠定了基础。
引用
@article{arxiv.2508.03440,
title = {LLMs are Single-threaded Reasoners: Demystifying the Working Mechanism of Soft Thinking},
author = {Junhong Wu and Jinliang Lu and Zixuan Ren and Gangqiang Hu and Zhi Wu and Dai Dai and Hua Wu},
journal= {arXiv preprint arXiv:2508.03440},
year = {2025}
}
备注
11 pages, 6 figures, working in progress