中文

通过因果能量最小化重新审视Transformer层参数化

机器学习 2026-05-11 v1 人工智能 机器学习

摘要

Transformer块通常将多头注意力(MHA)用于令牌混合,并将门控MLP用于逐令牌特征变换,但其参数化中的许多选择在很大程度上仍是经验性的。我们引入了因果能量最小化(CEM),这是一个将Transformer层重新解释为对条件能量函数的优化步骤,同时明确考虑层参数化的框架。CEM扩展了先前基于能量的注意力解释,表明权重共享的MHA可以推导为对交互能量的梯度更新,而具有共享上下投影的门控MLP可以通过逐元素能量来理解。这一视角识别了Transformer层的设计空间,包括层内权重共享、对角加低秩交互、轻量级预条件子和递归更新。我们在中等亿级参数规模的语言建模实验中评估了CEM衍生层。尽管参数化受限,这些层仍能稳定训练,并匹配相应的Transformer基线。总体而言,我们的结果表明CEM为理解Transformer层参数化提供了有用的视角,将Transformer架构与基于能量的模型联系起来,并激励了对能量引导层设计的进一步探索。

关键词

引用

@article{arxiv.2605.07588,
  title  = {Revisiting Transformer Layer Parameterization Through Causal Energy Minimization},
  author = {Jin Xu and Camille Couturier and Victor Rühle and Saravan Rajmohan and James Hensman},
  journal= {arXiv preprint arXiv:2605.07588},
  year   = {2026}
}