中文

自注意力作为参数端子函子:Transformer 架构的范畴框架

机器学习 2025-01-15 v2

摘要

自注意力机制已彻底革新了深度学习架构,但其核心数学结构仍未得到完全理解。本文发展了一个聚焦于自注意力线性组成部分的范畴论框架。具体而言,我们展示查询、键和值映射自然地定义于 2 范畴 Para(Vect)\mathbf{Para(Vect)} 中的参数 1-态射。在底层 1-范畴 Vect\mathbf{Vect} 上,这些映射诱导出一个 endofunctor,其迭代复合精确地建模了多层注意力。我们进一步证明,堆叠多个自注意力层对应于对该 endofunctor 上构建自由 monad。对于位置编码,我们展示严格可加嵌入对应于仿射意义上的单子作用,而标准正弦编码虽不具可加性,但仍在单射(忠实)位置保持映射中保留普遍属性。我们还建立了自注意力的线性部分对输入标记排列具有自然等价性,并展示了在机制可解释性中识别的“电路”可解释为参数 1-态射的复合。这种范畴视角统一了几何、代数和可解释性方法,以 Transformer 为分析,明确了注意力的底层结构。我们在整个过程中仅限于线性映射,推迟对诸如 softmax 和层归一化等非线性的处理,后者需要更高级的范畴构造。我们的结果建立在并扩展最近在深度学习范畴论基础工作之上,提供了对注意力机制代数结构的更深入洞察。

关键词

引用

@article{arxiv.2501.02931,
  title  = {Self-Attention as a Parametric Endofunctor: A Categorical Framework for Transformer Architectures},
  author = {Charles O'Neill},
  journal= {arXiv preprint arXiv:2501.02931},
  year   = {2025}
}