中文

FasterViT:具有分层注意力的快速视觉 Transformer

计算机视觉与模式识别 2024-04-03 v2 人工智能 机器学习

摘要

我们设计了一系列名为 FasterViT 的新型 CNN-ViT 混合神经网络,侧重于计算机视觉(CV)应用中的高图像吞吐率。FasterViT 结合了 CNN 中快速局部表示学习与 ViT 中全局建模特性的优势。我们新引入的分层注意力(HAT)方法将具有二次复杂度的全局自注意力分解为计算代价更低的多级注意力。我们受益于高效的基于窗口的自注意力。每个窗口可访问专用的 carrier token,参与局部与全局表示学习。在高层,全局自注意力以更低代价实现高效的跨窗口通信。FasterViT 在准确率与图像吞吐率方面实现了 SOTA 的 Pareto 前沿。我们已在分类、目标检测与分割等多种 CV 任务上广泛验证其有效性。我们还展示了 HAT 可作为即插即用模块用于现有网络并增强之。我们进一步证明,对高分辨率图像,其比竞争模型显著更快且更准确。代码见 https://github.com/NVlabs/FasterViT。

关键词

引用

@article{arxiv.2306.06189,
  title  = {FasterViT: Fast Vision Transformers with Hierarchical Attention},
  author = {Ali Hatamizadeh and Greg Heinrich and Hongxu Yin and Andrew Tao and Jose M. Alvarez and Jan Kautz and Pavlo Molchanov},
  journal= {arXiv preprint arXiv:2306.06189},
  year   = {2024}
}

备注

ICLR'24 Accepted Paper