软最大注意力的通用逼近
机器学习
2025-12-17 v2 人工智能
机器学习
摘要
我们证明了仅使用线性变换,两种注意力机制(i)两层自注意力和(ii)一层自注意力后接softmax函数,都是紧凑域上连续序列到序列函数的通用逼近器。我们的主要技术是一种新的基于插值的方法,用于分析注意力的内部机制。这导致了我们的关键洞察:自注意力能够以任意精度逼近ReLU的广义版本,因此涵盖了许多已知的通用逼近器。基于这些,我们展示了仅凭两层多头注意力即可作为序列到序列通用逼近器。相比之下,先前的工作依赖前馈网络来建立Transformer中的通用逼近。此外,我们将这些技术扩展显示示,(softmax-)注意力层能够在原位逼近各种统计模型。我们认为这些技术本身也具有独立的研究价值。
引用
@article{arxiv.2504.15956,
title = {Universal Approximation with Softmax Attention},
author = {Jerry Yao-Chieh Hu and Hude Liu and Hong-Yu Chen and Weimin Wu and Han Liu},
journal= {arXiv preprint arXiv:2504.15956},
year = {2025}
}
备注
v2 fixed typos, added model complexity and extended new transformer-naive UAP results in Appendix G