Transformer 是深度无限维非 Mercer 二值核机器
机器学习
2021-06-04 v1 机器学习
摘要
尽管以 Transformer 模型为代表的基于深度注意力的神经网络在自然语言处理等核心 AI 领域中无处不在,但其工作机制尚未被完全理解。在本文中,我们提出了一种理解 Transformer 如何工作的新视角。具体而言,我们表明作为 Transformer 运算核心的“点积注意力”可刻画为在一对 Banach 空间上的核学习方法。特别地,Transformer 的核被刻画为具有无限特征维数。在此过程中,我们将标准核学习问题推广到二值设定,其中数据来自两个输入域,且对每个跨域配对定义一个响应。我们针对这些具有非 Mercer(不定、非对称)核的二值核机器证明了一个新的表示定理(意味着所学习的函数是再生核 Banach 空间而非 Hilbert 空间中的元素),并证明了一个新的通用逼近定理,表明 Transformer 计算可以学习任意二值非 Mercer 再生核 Banach 空间对。我们使用 Transformer 中的新核进行实验,所得结果表明标准 Transformer 核的无限维数部分地决定了其性能。本文的结果为现代机器学习中一个非常重要但理解甚少模型提供了新的理论认识。
引用
@article{arxiv.2106.01506,
title = {Transformers are Deep Infinite-Dimensional Non-Mercer Binary Kernel Machines},
author = {Matthew A. Wright and Joseph E. Gonzalez},
journal= {arXiv preprint arXiv:2106.01506},
year = {2021}
}
备注
Work in progress, comments welcome