中文

视觉Transformer:ViT及其衍生模型

计算机视觉与模式识别 2022-05-25 v2

摘要

Transformer是一种基于注意力的编码器-解码器架构,不仅革新了自然语言处理(NLP)领域,也在计算机视觉(CV)领域做出了一些开创性工作。相较于卷积神经网络(CNNs),视觉Transformer(ViT)依靠出色的建模能力在ImageNet、COCO和ADE20k等多个基准上取得了非常好的性能。ViT受自然语言处理中自注意力机制的启发,将词嵌入替换为图像块嵌入。本文综述了ViT的衍生模型以及ViT与其他领域的交叉应用。

关键词

引用

@article{arxiv.2205.11239,
  title  = {Vision Transformer: Vit and its Derivatives},
  author = {Zujun Fu},
  journal= {arXiv preprint arXiv:2205.11239},
  year   = {2022}
}