视觉Transformer:基于词元的图像表示与处理用于计算机视觉
计算机视觉与模式识别
2020-11-23 v4 机器学习
图像与视频处理
摘要
计算机视觉通过(a)将图像表示为均匀排列的像素阵列以及(b)卷积高度局部化的特征取得了显著成功。然而,卷积平等对待所有图像像素而不论重要性;显式地对跨所有图像的所有概念建模而不论内容;并且难以关联空间上遥远的概念。在这项工作中,我们挑战这一范式:(a)将图像表示为语义视觉词元,以及(b)运行 transformer 来密集建模词元关系。关键的是,我们的视觉 Transformer 在语义词元空间中操作,根据上下文审慎地关注不同图像部分。这与像素空间 transformer 形成鲜明对比,后者需要数量级更多的计算量。使用先进的训练方案,我们的 VT 显著优于其卷积对应模型,在 ImageNet 上将 ResNet 的 top-1 准确率提高 4.6 至 7 个百分点,同时使用的 FLOPs 和参数更少。对于 LIP 和 COCO-stuff 上的语义分割,基于 VT 的特征金字塔网络(FPN)实现了高 0.35 个百分点的 mIoU,同时将 FPN 模块的计算量减少了 6.5 倍。
引用
@article{arxiv.2006.03677,
title = {Visual Transformers: Token-based Image Representation and Processing for Computer Vision},
author = {Bichen Wu and Chenfeng Xu and Xiaoliang Dai and Alvin Wan and Peizhao Zhang and Zhicheng Yan and Masayoshi Tomizuka and Joseph Gonzalez and Kurt Keutzer and Peter Vajda},
journal= {arXiv preprint arXiv:2006.03677},
year = {2020}
}