建立转换器类架构通用逼近的统一框架
机器学习
2025-10-22 v2 最优化与控制
摘要
我们研究了转换器类架构的通用逼近属性(UAP),提供了一个统一的理论框架,将先前关于残差网络的结果推广到包含注意力机制的模型。我们的工作确定了令牌可区分性作为UAP的基本要求,并引入一种适用于广泛类架构的通用充分条件。利用对注意力层的解析性假设,我们可以显著简化该条件的验证,提供一种非构造性方法来建立此类架构的UAP。我们通过对各种注意力机制(包括基于核的稀疏注意力机制)的转换器证明了UAP的适用性。我们的结果的推论要么概括先前工作,要么为此前未覆盖的架构建立UAP。此外,我们的框架为设计内含UAP保证的新型转换器架构提供了原则基础,包括具有特定函数对称性的架构。我们提供示例以说明这些见解。
引用
@article{arxiv.2506.23551,
title = {A unified framework for establishing the universal approximation of transformer-type architectures},
author = {Jingpu Cheng and Ting Lin and Zuowei Shen and Qianxiao Li},
journal= {arXiv preprint arXiv:2506.23551},
year = {2025}
}
备注
NeurIPS 2025 camera-ready