中文

通过对称性约化实现 Transformer 的显式关系性

机器学习 2026-02-24 v1 神经与进化计算 高能物理 - 理论 机器学习

摘要

Transformer 模型内部存在显著冗余,源于坐标依赖的表示和连续对称性,在模型空间和头部空间中分别体现。虽然近期方法通过显式破坏对称性来解决此问题,但我们提出了另一种基于对称性约化的框架。我们以不变关系量的形式重新表述表示、注意力机制及优化动力学,通过构造消除冗余自由度。这种视角产生的体系结构直接作用于关系结构,为减少参数冗余和分析优化提供了原则化的几何框架。

关键词

引用

@article{arxiv.2602.18948,
  title  = {Toward Manifest Relationality in Transformers via Symmetry Reduction},
  author = {J. François and L. Ravera},
  journal= {arXiv preprint arXiv:2602.18948},
  year   = {2026}
}

备注

12 pages