中文

深度语言模型中层更新的几何结构

机器学习 2026-04-06 v1 人工智能 计算与语言

摘要

我们研究深度语言模型中层更新的几何结构。与其分析中间表示中编码了什么信息,我们追问表示如何从一层变化到下一层。我们证明,层更新可分解为一个主导的逐词元分量和一个无法被受限词元函数类捕获的残差。在多种架构(包括Transformer和状态空间模型)中,我们发现完整层更新几乎完全与逐词元分量对齐,而残差表现出显著更弱的对齐性、更大的角度偏差,以及向主导逐词元子空间的投影显著更低。这表明残差并非微小的修正,而是变换中几何上不同的分量。这种几何分离具有功能后果:在受限词元模型下的近似误差与输出扰动密切相关,斯皮尔曼相关系数通常超过0.7,在更大模型中可达0.95。综合来看,这些结果表明大多数层更新像沿主导方向的结构化重参数化,而功能上重要的计算集中在几何上不同的残差分量中。我们的框架为探测现代语言模型中层更新的几何和功能结构提供了一种简单、架构无关的方法。

关键词

引用

@article{arxiv.2604.02459,
  title  = {On the Geometric Structure of Layer Updates in Deep Language Models},
  author = {Jun-Sik Yoo},
  journal= {arXiv preprint arXiv:2604.02459},
  year   = {2026}
}

备注

11 pages, 5 figures