中文

语义空间的几何:Transformer架构的连续几何框架

无序系统与神经网络 2026-07-19 v1 计算与语言 机器学习

摘要

我们提出了一个连续的几何框架,将Transformer架构的离散代数运算建模为语义纤维丛\calE=\calM×Rd\calE = \calM \times \R^d上的积分微分方程(IDE)。从一个单一的几何公理——标记序列形成一个带有规范测度格子的离散11-流形——出发,我们将现代Transformer的每个核心组件(RMSNorm、RoPE、Softmax注意力、FFN、残差流、SGD、权重衰减)转化为微分几何、测度论和随机微积分的连贯词汇。由此产生的框架产生了跨越熵最优输运(注意力作为Schr\"odinger桥)和非平衡热力学(SGD作为违反细致平衡的It\^{o}扩散)的定量预测。我们进行了六部分实验活动,跨越五种架构(Qwen3、LLaMA\nobreakdash-3.1、Gemma\nobreakdash-3、GPT-2、Mistral),参数范围从124124M到88B。经验可观测量与几何预测定量一致:在机器精度下的ϵ1/2\epsilon^{-1/2} Lipschitz缩放校准(R2=1.000R^2 = 1.000)、Lie--Trotter算子分裂扭转、确认拓扑稳定性对偶定律的对称消融不稳定性、RoPE环面上Poincar\'e重现的\calO(1/k)\calO(1/\sqrt{k})热力学抑制、热力学上下文极限相变以及非平衡稳态参数涡旋——通过两种优化器(AdamW和纯SGD)验证以排除动量伪影。结果表明,通过连续随机微分几何的视角分析Transformer,为大型语言模型的稳定性极限、上下文边界和优化动力学提供了预测性的描述词汇。

关键词

引用

@article{arxiv.2607.17146,
  title  = {The Geometry of Semantic Space: A Continuous Geometric Framework for the Transformer Architecture},
  author = {Zhihua Liang},
  journal= {arXiv preprint arXiv:2607.17146},
  year   = {2026}
}