中文

单层 Transformer 的通用逼近定理

机器学习 2025-07-16 v1 人工智能 机器学习

摘要

深度学习采用多层神经网络通过反向传播算法进行训练。这种方法在诸多领域取得成功,依赖于如 Adam 等自适应梯度方法。序列建模从循环神经网络演进为注意力机制模型,最终演变为 Transformer 架构。Transformer 在自然语言处理中取得 state-of-the-art 性能(例如 BERT 与 GPT-3),并在计算机视觉与计算生物学中得到应用。然而,这些模型的理论认识仍有限。本文审查了深度学习的数学基础与 Transformer,并提出一种新理论结果。我们回顾了线性代数、概率与优化的关键概念,这些概念构成深度学习的基础,详细分析了多头自注意力机制与反向传播算法。我们的主要贡献是针对 Transformer 提出通用逼近定理:我们证明,由单个 Transformer 构成,其包含一个自注意力层,随后是带有 ReLU 激活函数的位置惩罚网络,可对紧凑域上的任意连续序列到序列映射实现任意精度的逼近。我们提供正式表述与完整证明。最后,我们呈现案例研究,展示该结果的实际意义。我们的发现推进了 Transformer 模型的理论理解,帮助弥合了理论与实践之间的鸿沟。

关键词

引用

@article{arxiv.2507.10581,
  title  = {Universal Approximation Theorem for a Single-Layer Transformer},
  author = {Esmail Gumaan},
  journal= {arXiv preprint arXiv:2507.10581},
  year   = {2025}
}

备注

7 pages, 2 figures, 1 theorem, 10 formulas