X-ViT:无 Softmax 的高性能线性视觉 Transformer
计算机视觉与模式识别
2022-05-30 v1 机器学习
摘要
视觉 Transformer 已成为计算机视觉任务最重要的模型之一。尽管它们优于先前工作,但其所需计算资源沉重,规模与令牌数 呈二次方关系。这是传统自注意力(SA)算法的主要缺陷。在此,我们提出 X-ViT,一种具有线性复杂度新颖 SA 机制的 ViT。本工作的主要方法是消除原始 SA 中的非线性。我们在不进行复杂线性近似的情况下对 SA 机制的矩阵乘法进行分解。通过仅修改原始 SA 的几行代码,所提模型在大多数容量区间上的图像分类和密集预测任务中优于大多数基于 Transformer 的模型。
引用
@article{arxiv.2205.13805,
title = {X-ViT: High Performance Linear Vision Transformer without Softmax},
author = {Jeonggeun Song and Heung-Chang Lee},
journal= {arXiv preprint arXiv:2205.13805},
year = {2022}
}