中文

软思考:在连续概念空间中释放大语言模型推理潜能

计算与语言 2025-05-22 v1 人工智能

摘要

人类认知通常涉及对抽象、流动概念进行思考,而非严格使用离散语言标记。然而,当前的推理模型受限于人类语言的边界,仅能处理表示语义空间中固定点的离散标记嵌入。这种离散约束限制了推理模型的表达能力和上限潜力,常导致推理路径的不完整探索,因为标准的链式思考(CoT)方法仅在每一步中采样一个标记。在本工作中,我们引入软思考(Soft Thinking),这是一种无训练方法,通过生成连续概念空间中的软、抽象概念标记,来模拟人类类似的“软”推理。这些概念标记由标记嵌入的概率加权混合创建,形成连续概念空间,使其能够实现平滑的转换和更丰富的表示,超越传统的离散边界。简而言之,每个生成的概念标记都封装了来自相关离散标记的多个含义,隐式地探索各种推理路径,以有效地收敛到正确答案。对多样化数学和编码基准的经验评估持续显示,软思考的有效性和效率,使其在标准CoT方法相比下,将通过率提升最高可达2.48分,同时减少最高可达22.4%的标记用量。定性分析进一步表明,软思考的输出保持高度可解释性和可读性,凸显了软思考有望突破离散语言基于推理的固有瓶颈的潜力。代码已提供:https://github.com/eric-ai-lab/Soft-Thinking。

关键词

引用

@article{arxiv.2505.15778,
  title  = {Soft Thinking: Unlocking the Reasoning Potential of LLMs in Continuous Concept Space},
  author = {Zhen Zhang and Xuehai He and Weixiang Yan and Ao Shen and Chenyang Zhao and Shuohang Wang and Yelong Shen and Xin Eric Wang},
  journal= {arXiv preprint arXiv:2505.15778},
  year   = {2025}
}