卷积嵌入增强分层视觉Transformer性能
计算机视觉与模式识别
2022-08-02 v2 人工智能
摘要
Vision Transformers(ViTs)近来在一系列计算机视觉任务中占据主导地位,但在缺乏适当归纳偏置时,其训练数据效率低下且局部语义表示能力较弱。卷积神经网络(CNNs)天然捕获区域感知语义,启发研究者将CNNs重新引入ViTs的架构以为ViTs提供理想的归纳偏置。然而,嵌入ViTs中的微级CNNs所实现的局部性是否足够好?本文通过深入探究混合CNNs/ViTs的宏观架构如何提升分层ViTs的性能来研究该问题。特别地,我们研究了token嵌入层(即卷积嵌入(CE))的作用,并系统性地揭示了CE如何向ViTs注入理想的归纳偏置。此外,我们将最优CE配置应用于4种近期发布的最先进ViTs,有效提升了相应性能。最后,发布了一系列高效的混合CNNs/ViTs,称为CETNets,可作为通用视觉主干网络。具体而言,CETNets在ImageNet-1K上达到84.9%的Top-1准确率(从头训练),在COCO基准上达到48.6%的box mAP,在ADE20K上达到51.6%的mIoU,大幅提升了相应最先进基线的性能。
引用
@article{arxiv.2207.13317,
title = {Convolutional Embedding Makes Hierarchical Vision Transformer Stronger},
author = {Cong Wang and Hongmin Xu and Xiong Zhang and Li Wang and Zhitong Zheng and Haifeng Liu},
journal= {arXiv preprint arXiv:2207.13317},
year = {2022}
}
备注
ECCV 2022