中文

通过因果能量最小化重访Transformer层参数化

组合数学 2026-05-11 v1 离散数学

摘要

Transformer块通常组合多头注意力(MHA)用于token混合,以及带门控MLP用于token级特征转换,但其参数化中的许多选择仍主要是经验性的。我们引入因果能量最小化(CEM),将Transformer层重新诠释为对条件能量函数进行优化步骤,同时显式考虑层参数化。扩展先前的注意力能量基于解释,CEM显示,重 tied MHA可作为交互能量的梯度更新推导而来,而带有共享上下/下投影的门控MLP可通过元素级能量来理解。这种视角识别了Transformer层的设计空间,包括层内权重共享、对角线+低秩相互作用、轻量级 preconditioner以及递归更新。我们在中等规模的百万参数语言模型实验中评估了CEM派生的层。尽管这些层的参数化受到约束,但能够稳定训练并匹配相应的Transformer基线。总体而言,我们的结果表明CEM为理解Transformer层参数化提供了有用的视角,将Transformer架构连接到能量基模型,并激励进一步探索能量导向的层设计。

关键词

引用

@article{arxiv.2605.07587,
  title  = {A Combinatorial Framework for the Pons-Batle Identity: Young Tableaux, Lattice Paths, and Limit Laws},
  author = {Hexuan Liu and Michael Wallner and Guan-Ru Yu},
  journal= {arXiv preprint arXiv:2605.07587},
  year   = {2026}
}

备注

To appear in the Proceedings of the 37th International Conference / Meeting on Probabilistic, Combinatorial and Asymptotic Methods for the Analysis of Algorithms (AofA 2026), Munich, Germany