中文

关于注意力模拟器的普遍性存在性

机器学习 2026-04-23 v2 人工智能

摘要

关于 transformer 可学习性的 prior 工作主要聚焦于其通过训练逼近特定算法模式的能力,提供的仅是概率性保证而非确定性解。相反,可表达性研究则旨在从理论角度探讨此类架构可计算问题。这些结果证明了 transformer 的图灵完备性,探讨了围绕电路复杂度和形式逻辑的界限。处于可学习性与可表达性之间的交叉位置,仍有一个根本问题值得关注:transformer 作为计算模型,能否模拟任意注意力机制,或更具体地,能否模拟其底层操作?本研究探讨了 transformer 编码器模拟 vanilla 注意力机制的能力。通过构建由 transformer 编码器组成的普遍模拟器 U\mathcal{U},我们提出算法解决方案,以复制注意力输出及底层基本矩阵和激活操作。我们展示了一个在数据无关条件下可实现的算法解,此前仅知其可通过学习方式近似实现。

关键词

引用

@article{arxiv.2506.18739,
  title  = {On the Existence of Universal Simulators of Attention},
  author = {Debanjan Dutta and Anish Chakrabarty and Faizanuddin Ansari and Swagatam Das},
  journal= {arXiv preprint arXiv:2506.18739},
  year   = {2026}
}