注意力机制、最大仿射分区与通用逼近
机器学习
2025-04-29 v1 人工智能
机器学习
摘要
我们确立了单层单头自注意力和交叉注意力机制(带最小附加结构)的通用逼近能力。我们的关键洞察是将单头注意力解释为输入域分区机制,以对不同子区域分配不同值。这使我们能够对注意力权重进行工程化,从而使这种分配模仿目标函数。基于此,我们证明,在 范数下,单层自注意力层(紧跟线性变换之和)能够对紧凑域上的任意连续函数进行逼近。进一步地,我们将此构造扩展到在 范数()下逼近任意 Lebesgue 可积函数。最后,我们也扩展了我们的技术,首次展示单头交叉注意力具有相同的通用逼近保证。
引用
@article{arxiv.2504.19901,
title = {Attention Mechanism, Max-Affine Partition, and Universal Approximation},
author = {Hude Liu and Jerry Yao-Chieh Hu and Zhao Song and Han Liu},
journal= {arXiv preprint arXiv:2504.19901},
year = {2025}
}