中文

ViG:基于门控线性注意力的线性复杂度视觉序列学习

计算机视觉与模式识别 2024-05-30 v2 人工智能

摘要

最近,线性复杂度序列建模网络在各种计算机视觉任务上实现了与 Vision Transformer 类似的建模能力,同时使用更少的 FLOPs 和内存。然而,这些方法在实际运行速度上的优势并不显著。为此,我们引入面向视觉的门控线性注意力(Gated Linear Attention, GLA),凭借其卓越的硬件感知性和效率优势。我们提出了方向感知门控机制,通过双向建模捕获1D 全局上下文,并提出2D 门控局部注入机制,以适应性方式将2D 局部细节注入1D 全局上下文中。我们的硬件感知实现进一步将前向和反向扫描合并到单个 kernel 中,提高并行度,降低内存消耗和延迟。所提出的模型 ViG 在 ImageNet 及下游任务中在准确率、参数数目和 FLOPs 之间实现了有利的权衡,超越了流行的 Transformer 和 CNN-based 模型。值得注意的是,ViG-S 在保持与 DeiT-B 相同准确率的同时,仅使用其参数的27% 和 FLOPs的20%,在 224×224224\times224 图像上运行速度提升2倍。在 1024×10241024\times1024 分辨率下,ViG-T 使用其 FLOPs的5.2倍更少,节省90% GPU 内存,运行速度提升4.8倍,并以DeiT-T 的20.7% 更高的 top-1 准确率。这些结果将 ViG 定位为一种高效且可扩展的视觉表征学习解决方案。代码已公开:https://github.com/hustvl/ViG。

关键词

引用

@article{arxiv.2405.18425,
  title  = {ViG: Linear-complexity Visual Sequence Learning with Gated Linear Attention},
  author = {Bencheng Liao and Xinggang Wang and Lianghui Zhu and Qian Zhang and Chang Huang},
  journal= {arXiv preprint arXiv:2405.18425},
  year   = {2024}
}

备注

Work in progress. Code is available at \url{https://github.com/hustvl/ViG}