中文

注意力机制、最大仿射分区与通用逼近

机器学习 2025-04-29 v1 人工智能 机器学习

摘要

我们确立了单层单头自注意力和交叉注意力机制(带最小附加结构)的通用逼近能力。我们的关键洞察是将单头注意力解释为输入域分区机制,以对不同子区域分配不同值。这使我们能够对注意力权重进行工程化,从而使这种分配模仿目标函数。基于此,我们证明,在 LL_\infty 范数下,单层自注意力层(紧跟线性变换之和)能够对紧凑域上的任意连续函数进行逼近。进一步地,我们将此构造扩展到在 LpL_p 范数(1p<1\leq p <\infty)下逼近任意 Lebesgue 可积函数。最后,我们也扩展了我们的技术,首次展示单头交叉注意力具有相同的通用逼近保证。

关键词

引用

@article{arxiv.2504.19901,
  title  = {Attention Mechanism, Max-Affine Partition, and Universal Approximation},
  author = {Hude Liu and Jerry Yao-Chieh Hu and Zhao Song and Han Liu},
  journal= {arXiv preprint arXiv:2504.19901},
  year   = {2025}
}