视觉Transformer:ViT及其衍生模型
计算机视觉与模式识别
2022-05-25 v2
摘要
Transformer是一种基于注意力的编码器-解码器架构,不仅革新了自然语言处理(NLP)领域,也在计算机视觉(CV)领域做出了一些开创性工作。相较于卷积神经网络(CNNs),视觉Transformer(ViT)依靠出色的建模能力在ImageNet、COCO和ADE20k等多个基准上取得了非常好的性能。ViT受自然语言处理中自注意力机制的启发,将词嵌入替换为图像块嵌入。本文综述了ViT的衍生模型以及ViT与其他领域的交叉应用。
引用
@article{arxiv.2205.11239,
title = {Vision Transformer: Vit and its Derivatives},
author = {Zujun Fu},
journal= {arXiv preprint arXiv:2205.11239},
year = {2022}
}