视觉Transformer综述
计算机视觉与模式识别
2022-12-07 v4
摘要
Transformer是一种基于注意力的编码器-解码器模型,已经彻底改变了自然语言处理(NLP)领域。受这些重大成就的启发,一些开创性工作最近将类Transformer架构引入计算机视觉(CV)领域,证明了它们在三个基本CV任务(分类、检测与分割)以及多种感知数据流(图像、点云和视觉-语言数据)上的有效性。由于其具有竞争力的建模能力,视觉Transformer相较于现代卷积神经网络(CNNs)在多个基准上取得了令人印象深刻的性能提升。在本综述中,我们依据三个基本CV任务和不同数据流类型,全面回顾了一百余种不同的视觉Transformer,并提出了一种分类法,根据其动机、结构和应用场景对代表性方法进行组织。由于它们在训练设置和专用视觉任务上的差异,我们还从不同配置下对这些现有视觉Transformer进行了评估与比较。此外,我们揭示了一系列关键但未被充分探索的方面,可能使这些视觉Transformer从众多架构中脱颖而出,例如利用松弛的高层语义嵌入来弥合视觉Transformer与序列Transformer之间的差距。最后,给出了三个有前景的未来研究方向。我们将在 https://github.com/liuyang-ict/awesome-visual-transformers 持续更新最新文章及其发布的源代码。
引用
@article{arxiv.2111.06091,
title = {A Survey of Visual Transformers},
author = {Yang Liu and Yao Zhang and Yixin Wang and Feng Hou and Jin Yuan and Jiang Tian and Yang Zhang and Zhongchao Shi and Jianping Fan and Zhiqiang He},
journal= {arXiv preprint arXiv:2111.06091},
year = {2022}
}
备注
Accepted by IEEE Transactions on Neural Networks and Learning Systems (TNNLS)