视觉Transformer近期进展:综述与前沿工作展望
计算机视觉与模式识别
2023-10-18 v5 人工智能
摘要
相较于卷积神经网络(CNNs),视觉Transformer(ViTs)正成为日益流行且在各类视觉任务中占主导地位的技术。作为计算机视觉中的一项重要技术,ViTs在关注长程关系的同时已成功解决多种视觉问题。本文首先介绍自注意力机制的基本概念与背景。接着,我们全面概述近期性能优异的ViT方法,从优势与不足、计算代价以及训练与测试数据集等方面进行阐述。我们在常用基准数据集上细致比较了各类ViT算法与最具代表性的CNN方法的性能。最后,我们通过深入观察探讨了若干局限性,并给出进一步的研究方向。项目页面及论文合集见 https://github.com/khawar512/ViT-Survey
引用
@article{arxiv.2203.01536,
title = {Recent Advances in Vision Transformer: A Survey and Outlook of Recent Work},
author = {Khawar Islam},
journal= {arXiv preprint arXiv:2203.01536},
year = {2023}
}
备注
Added AAAI 2022 methods and working on ICLR 2022 methods and ICML 2022