中文

早期卷积帮助视觉 Transformer 看得更好

计算机视觉与模式识别 2021-10-27 v3

摘要

视觉 Transformer(ViT)模型表现出不佳的可优化性。特别是,它们对优化器选择(AdamW 与 SGD)、优化器超参数和训练时长敏感。相比之下,现代卷积神经网络更易优化。为何如此?本工作中,我们推测问题出在 ViT 模型的 patchify stem(图像块化主干),其通过对输入图像施加步长 p、核 p*p 的卷积实现(默认 p=16)。这种大核加 large-stride(大步长)卷积与神经网络中卷积层的典型设计选择相悖。为检验这一非典型设计是否导致问题,我们分析了使用原始 patchify stem 的 ViT 模型与简单对照(将 ViT stem 替换为少量堆叠的步长 2 的 3*3 卷积)的优化行为。尽管两种 ViT 设计的绝大部分计算相同,我们发现早期视觉处理的这一微小改变在优化设置敏感性及最终模型精度方面带来了显著不同的训练行为。在 ViT 中使用卷积 stem 大幅提升了优化稳定性,并改善了峰值性能(在 ImageNet-1k 上 top-1 精度提升约 1-2%),同时保持 flops 和运行时。该改进可在广泛模型复杂度(1G 至 36G flops)和数据集规模(ImageNet-1k 至 ImageNet-21k)范围内观察到。这些发现使我们推荐在此类情况下为 ViT 模型使用标准轻量卷积 stem,作为比原始 ViT 设计更鲁棒的结构选择。

关键词

引用

@article{arxiv.2106.14881,
  title  = {Early Convolutions Help Transformers See Better},
  author = {Tete Xiao and Mannat Singh and Eric Mintun and Trevor Darrell and Piotr Dollár and Ross Girshick},
  journal= {arXiv preprint arXiv:2106.14881},
  year   = {2021}
}

备注

NeurIPS 2021