中文

Transformer学习理论:通过Softmax单位分解实现局部到全局逼近

机器学习 2026-05-12 v1 机器学习

摘要

本文探讨了在紧凑欧几里得域 [0,1]d[0,1]^ddd维紧凑黎曼流形上的回归任务中,Transformer网络的学习理论。我们提出一种新型构造性逼近框架,用于Transformer,通过softmax单位分解构建目标函数的局部逼近并聚合为全局逼近。该方法利用注意力机制通过仿射变换实现空间局部化。softmax激活在将局部逼近聚合为全局输出中发挥关键作用。从逼近角度看,我们证明,仅包含两个编码器块和标准单隐藏层逐点前馈网络的密集Transformer,可使用 O(εd/α)\mathcal{O}(\varepsilon^{-d/\alpha}) 个总参数实现对 α\alpha-H"older连续函数的均匀 ε\varepsilon逼近误差,其中 α(0,1]\alpha \in (0,1]。在此逼近保证基础上,我们建立了一个阶为 O(n2α2α+dlogn)\mathcal{O}\big(n^{-\frac{2\alpha}{2\alpha+d}} \log n\big) 的近 minimax 最优泛化误差界,其中 nn 为训练数据规模。本文研究的Transformer架构为密集、浅层和宽网络,采用softmax激活和正弦位置编码,紧密反映实际实现。

关键词

引用

@article{arxiv.2605.08811,
  title  = {Learning Theory of Transformers: Local-to-Global Approximation via Softmax Partition of Unity},
  author = {Zhongjie Shi and Wenjing Liao},
  journal= {arXiv preprint arXiv:2605.08811},
  year   = {2026}
}