中文

Transformers as Intrinsic Optimizers: 基于能量原理的前向推理

机器学习 2026-01-13 v2

摘要

注意力机制的Transformer模型在广泛的任务上展现出强大的适应性,已成为现代大型语言模型(LLMs)的骨架。然而,其背后的机制仍值得进一步探索。能量方法长期为理解神经计算提供了有价值的原理。本文从能量视角重新审视注意力机制Transformer模型。我们提出了统一的能量框架,由三个关键组件构成:局部能量EiE_i、全局能量FF以及采用的优化算法。我们表明,包括未标准化线性注意力、门控线性注意力和标准softmax注意力在内的各种注意力形式,都可以通过在该框架中选择相应的配方来实现。基于该框架,我们提出了注意力结构的能量化修改。灵感来自经典梯度下降(GD)算法,我们将原始注意力公式基于标准GD扩展到动量式GD、Nesterov加速梯度(NAG)和牛顿法,每种方法均诱导出相应的注意力结构。我们的实验提供了初步支持,表明能量框架在设计注意力机制方面具有潜力。

关键词

引用

@article{arxiv.2511.00907,
  title  = {Transformers as Intrinsic Optimizers: Forward Inference through the Energy Principle},
  author = {Ruifeng Ren and Sheng Ouyang and Huayi Tang and Yong Liu},
  journal= {arXiv preprint arXiv:2511.00907},
  year   = {2026}
}