Transformer 网络对 Maxout 网络及连续分段线性函数的表征能力研究
机器学习
2026-03-04 v1 人工智能
摘要
Transformer 网络在广泛的应用领域取得了显著的经验成功,但其理论上的表征能力仍不充分地理解。在本文中,我们研究 Transformer 架构的表征能力。我们首先在保持可 comparable model complexity 的情况下,明确近似 maxout 网络的 Transformer 网络。作为结果,Transformer 继承了在类似复杂度约束下,ReLU 网络的通用逼近能力。基于这一联系,我们发展了一个框架来分析 Transformer 对连续分段线性函数的逼近,并通过线性区域数量定量描述其表征能力,该数量随深度呈指数增长。我们的分析在标准前馈神经网络的逼近理论与 Transformer 架构之间建立了理论桥梁。它还产生成本性见解:注意力层实现 max-type 操作,而前馈层实现 token-wise 仿射变换。
引用
@article{arxiv.2603.03084,
title = {On the Expressive Power of Transformers for Maxout Networks and Continuous Piecewise Linear Functions},
author = {Linyan Gu and Lihua Yang and Feng Zhou},
journal= {arXiv preprint arXiv:2603.03084},
year = {2026}
}