中文

提升视觉Transformer网络效率:设计技术与洞见

图像与视频处理 2024-04-01 v1 计算机视觉与模式识别 机器学习

摘要

受人类视觉系统在复杂场景中识别显著区域的固有能力启发,注意力机制已被无缝集成到各种计算机视觉任务中。基于这一范式,视觉Transformer网络利用注意力机制来提高效率。本综述探讨了视觉Transformer中重新设计的注意力机制,旨在提升其性能。本文全面探索了设计注意力机制的技术与洞见,系统性地回顾了计算机视觉领域的最新文献。本综述首先介绍了注意力机制的理论基础和基本概念。然后,我们提出了视觉Transformer中各种注意力机制的系统分类法,采用了重新设计的方法。基于其应用、目标和所应用的注意力类型,提出了一种多视角分类。分析包括对新颖性、优势、劣势的探讨,以及对不同提出策略的深入评估。最终形成了突出关键属性和贡献的分类法。最后,我们将所综述的研究及其可用的开源实现汇总到我们的GitHub上。我们旨在定期用最新的相关论文更新它。

关键词

引用

@article{arxiv.2403.19882,
  title  = {Enhancing Efficiency in Vision Transformer Networks: Design Techniques and Insights},
  author = {Moein Heidari and Reza Azad and Sina Ghorbani Kolahi and René Arimond and Leon Niggemeier and Alaa Sulaiman and Afshin Bozorgpour and Ehsan Khodapanah Aghdam and Amirhossein Kazerouni and Ilker Hacihaliloglu and Dorit Merhof},
  journal= {arXiv preprint arXiv:2403.19882},
  year   = {2024}
}

备注

Submitted to Computational Visual Media Journal