中文

Hyper-SET:基于球面能最小化设计 Transformer

机器学习 2025-06-02 v3

摘要

Transformer 模型取得了显著的成功,但其核心组件——Transformer 层仍大多由启发式方法从底层设计,亟需一个具备高可解释性和实际性能的原型模型。为此,我们提出一种基于能源解释的原则化、自上而下的方法。具体而言,我们将 token 动力学形式化为球面上的联合最大似然估计,具有两个特性:在高维空间中的语义对齐和在低维空间中的分布均匀性。通过对这两个特性使用扩展 Hopfield 能量函数进行量化,我们将其实例化为约束能量最小化问题,从而实现对称注意力和前馈模块的设计,采用 RMS 归一化。我们进一步提出了“球面能量 Transformer”(Hyper-SET),这是一种自然从球面上的迭代能优化中产生的 vanilla Transformer 的循环深度替代方案。通过在各层间共享参数,Hyper-SET 能够以更少的参数扩展到任意深度。理论上有据可依且结构紧凑,Hyper-SET 在包括数独求解、图像分类和掩码图像建模在内的多种任务上实现了竞争甚至优于性能。我们还在所提出的通用原则下设计了新变体,如线性注意力和门控前馈层。此外,我们展示了其在深度方向的 LoRA 可扩展性。我们的结果表明,Hyper-SET 是通向可解释且原则化 Transformer 设计的一步重要进展。

关键词

引用

@article{arxiv.2502.11646,
  title  = {Hyper-SET: Designing Transformers via Hyperspherical Energy Minimization},
  author = {Yunzhe Hu and Difan Zou and Dong Xu},
  journal= {arXiv preprint arXiv:2502.11646},
  year   = {2025}
}

备注

31 pages