视觉 Transformer 是否像卷积神经网络一样观察?
计算机视觉与模式识别
2022-03-07 v2 人工智能
机器学习
机器学习
摘要
卷积神经网络(CNNs)迄今为止一直是视觉数据的实际标准模型。近期工作表明(视觉)Transformer 模型(ViT)在图像分类任务上可达到可比甚至更优的性能。这引出了一个核心问题:视觉 Transformer 是如何解决这些任务的?它们是像卷积网络那样行动,还是学习了完全不同的视觉表征?通过分析 ViT 与 CNN 在图像分类基准上的内部表征结构,我们发现两种架构间存在显著差异,例如 ViT 在所有层上具有更均匀的表征。我们探究了这些差异的成因,发现自注意力起到了关键作用,其实现了全局信息的早期聚合,而 ViT 的残差连接则强力地将低层特征传播至高层。我们研究了其对空间定位的影响,证明 ViT 成功保留了输入空间信息,且不同分类方法带来显著效应。最后,我们研究了(预训练)数据集规模对中间特征与迁移学习的影响,并讨论了与 MLP-Mixer 等新架构的关联。
引用
@article{arxiv.2108.08810,
title = {Do Vision Transformers See Like Convolutional Neural Networks?},
author = {Maithra Raghu and Thomas Unterthiner and Simon Kornblith and Chiyuan Zhang and Alexey Dosovitskiy},
journal= {arXiv preprint arXiv:2108.08810},
year = {2022}
}