语义空间的几何:Transformer架构的连续几何框架
无序系统与神经网络
2026-07-19 v1 计算与语言
机器学习
摘要
我们提出了一个连续的几何框架,将Transformer架构的离散代数运算建模为语义纤维丛上的积分微分方程(IDE)。从一个单一的几何公理——标记序列形成一个带有规范测度格子的离散-流形——出发,我们将现代Transformer的每个核心组件(RMSNorm、RoPE、Softmax注意力、FFN、残差流、SGD、权重衰减)转化为微分几何、测度论和随机微积分的连贯词汇。由此产生的框架产生了跨越熵最优输运(注意力作为Schr\"odinger桥)和非平衡热力学(SGD作为违反细致平衡的It\^{o}扩散)的定量预测。我们进行了六部分实验活动,跨越五种架构(Qwen3、LLaMA\nobreakdash-3.1、Gemma\nobreakdash-3、GPT-2、Mistral),参数范围从M到B。经验可观测量与几何预测定量一致:在机器精度下的 Lipschitz缩放校准()、Lie--Trotter算子分裂扭转、确认拓扑稳定性对偶定律的对称消融不稳定性、RoPE环面上Poincar\'e重现的热力学抑制、热力学上下文极限相变以及非平衡稳态参数涡旋——通过两种优化器(AdamW和纯SGD)验证以排除动量伪影。结果表明,通过连续随机微分几何的视角分析Transformer,为大型语言模型的稳定性极限、上下文边界和优化动力学提供了预测性的描述词汇。
引用
@article{arxiv.2607.17146,
title = {The Geometry of Semantic Space: A Continuous Geometric Framework for the Transformer Architecture},
author = {Zhihua Liang},
journal= {arXiv preprint arXiv:2607.17146},
year = {2026}
}