Primal-Attention:通过原始表示中的非对称核奇异值分解实现自注意力
机器学习
2023-12-06 v2 人工智能
计算机视觉与模式识别
摘要
近来,一系列新工作通过将Transformer中的自注意力视为核机器来理解和改进它。然而,现有工作将对称核的方法应用于非对称自注意力,导致分析理解与数值实现之间存在显著差距。本文提供了一种新的视角,通过非对称核奇异值分解(KSVD)来表示和优化自注意力,这也受到深层中通常观测到的自注意力低秩特性的启发。通过非对称KSVD,)构建了自注意力的原始-对偶表示,其中优化目标被转化为最大化注意力输出中的投影方差;)通过KSVD的原始表示提出了一种新颖的注意力机制,即Primal-Attention,避免了在対偶中显式计算核矩阵;)利用KKT条件,我们证明了Primal-Attention中KSVD优化的平稳解给出零值目标。以此方式,KSVD优化可通过简单最小化正则化损失来实现,从而在不额外分解的情况下促进低秩特性。数值实验显示了我们的Primal-Attention具有SOTA性能且效率更高。此外,我们证明了所部署的KSVD优化使Primal-Attention相比标准自注意力具有更尖锐的奇异值衰减,进一步验证了本方法的巨大潜力。据我们所知,这是首个为非对称核自注意力提供原始-对偶表示并成功应用于建模与优化的工作。
引用
@article{arxiv.2305.19798,
title = {Primal-Attention: Self-attention through Asymmetric Kernel SVD in Primal Representation},
author = {Yingyi Chen and Qinghua Tao and Francesco Tonin and Johan A. K. Suykens},
journal= {arXiv preprint arXiv:2305.19798},
year = {2023}
}
备注
NeurIPS 2023. We provide a primal-dual representation for the asymmetric self-attention in transformer that allows to avoid explicit computation of the kernel matrix