中文

思维的几何:尺度如何重构大型语言模型的推理

人工智能 2026-04-01 v2 机器学习

摘要

尺度并非均匀地改善推理,而是对其进行重构。通过分析四个领域(法律、科学、代码、数学)和两种规模(8B、70B参数)的25,000多条思维链轨迹,我们发现神经缩放定律引发了特定领域的相变,而非均匀的能力提升。法律推理经历了结晶化:表征维度(d95:501 -> 274)坍缩45%,轨迹对齐度增加31%,流形解纠缠提升10倍。科学和数学推理保持液态——尽管参数增加9倍,但在几何上保持不变。代码推理形成了由战略模式组成的离散晶格(轮廓系数:0.13 -> 0.42)。这种几何特性预测了可学习性。我们引入了神经推理算子——从初始隐藏状态到终端隐藏状态的学习映射。在结晶化的法律推理中,我们的算子通过探针解码在留出任务上实现了63.6%的准确率,无需遍历中间状态即可预测推理终点。我们进一步发现了一种普遍的振荡特征(相干性约 -0.4),在不同领域和尺度下保持不变,这表明注意力层和前馈层通过相反的动力学驱动推理。这些发现表明,思维的成本不由任务难度决定,而是由流形几何决定——为在拓扑结构允许的情况下加速推理提供了蓝图。

关键词

引用

@article{arxiv.2601.13358,
  title  = {The Geometry of Thought: How Scale Restructures Reasoning In Large Language Models},
  author = {Samuel Cyrenius Anderson},
  journal= {arXiv preprint arXiv:2601.13358},
  year   = {2026}
}

备注

The theoretical framework has been shown to be wrong and should not be followed for future research direction