中文

大型语言模型推理中出现的 Manifold 可分离性

机器学习 2026-05-11 v2

摘要

链路思考(Chain-of-Thought, CoT)提示显著提高了大型语言模型的推理能力,但其背后表示几何的时序动态仍鲜有了解。我们通过将流形容量理论(Manifold Capacity Theory, MCT)应用于两种组成推理任务来探索这些动态:一个受控的布尔逻辑树,支持深入的机制分析;以及一个自然语言资格任务,模型需从文本中提取属性、与阈值比较并通过固定评估树组合局部决策。MCT 使我们能够在探针训练无关干扰因素的情况下量化潜在表示的线性可分性。在两种任务中以及跨多个开源模型中,推理表现为一种瞬时几何脉冲:概念流形在计算前立即被分离到线性可分子空间中,然后迅速压缩。该行为与标准线性探针准确率不同,后者在计算后仍保持高水平,这表明信息是何种可被检索的信息与几何准备好用于处理的信息之间存在根本区别。我们将这一现象解释为动态流形管理(Dynamic Manifold Management),即模型动态调节表示容量以优化推理链中残差流的带宽。

关键词

引用

@article{arxiv.2602.20338,
  title  = {Emergent Manifold Separability during Reasoning in Large Language Models},
  author = {Chanwoo Chun and Alexandre Polo and SueYeon Chung},
  journal= {arXiv preprint arXiv:2602.20338},
  year   = {2026}
}

备注

Alexandre Polo and Chanwoo Chun contributed equally to this work