ViTALiTy:以线性泰勒注意力统一低秩与稀疏近似以加速视觉 Transformer
计算机视觉与模式识别
2022-11-10 v1 硬件体系结构
机器学习
摘要
Vision Transformer(ViT)已成为卷积神经网络在各种计算机视觉应用中的有力替代方案。具体而言,ViT 的多头注意力层使得在整幅图像上全局嵌入信息成为可能。然而,计算与存储此类注意力矩阵会带来关于图像块数量的二次方代价依赖,限制了其可达效率与可扩展性,并阻碍了 ViT 在资源受限设备上更广泛的真实世界应用。稀疏注意力已被证明是提升 NLP 模型硬件加速效率的有前景方向。然而,用于加速 ViT 模型的系统性对应方法仍然缺失。为弥补上述缺口,我们提出一种首创的算法-硬件协同设计框架,称为 ViTALiTy,以提升 ViT 的推理效率。不同于基于稀疏性的 NLP Transformer 加速器,ViTALiTy 统一了 ViT 中注意力的低秩与稀疏分量。在算法层面,我们通过以行均值中心化的一阶泰勒注意力作为低秩分量来近似点积 softmax 操作,以线性化注意力块代价,并进一步通过引入基于稀疏的正则化来提升精度。在硬件层面,我们开发了专用加速器,以更好地利用来自 ViTALiTy 线性泰勒注意力(仅需执行低秩分量)的工作负载与流水线,进一步提升硬件效率。大量实验与消融研究证实,相较于最先进方案,ViTALiTy 在可比精度下提供了提升的端到端效率(例如快 且节能 )。
引用
@article{arxiv.2211.05109,
title = {ViTALiTy: Unifying Low-rank and Sparse Approximation for Vision Transformer Acceleration with a Linear Taylor Attention},
author = {Jyotikrishna Dass and Shang Wu and Huihong Shi and Chaojian Li and Zhifan Ye and Zhongfeng Wang and Yingyan Lin},
journal= {arXiv preprint arXiv:2211.05109},
year = {2022}
}
备注
14 pages, 15 figures, Accepted to IEEE HPCA 2023