ConViT:以软卷积归纳偏置改进视觉 Transformer
计算机视觉与模式识别
2022-12-07 v2 机器学习
机器学习
摘要
卷积架构已被证明在视觉任务上极为成功。其硬归纳偏置实现了样本高效学习,但代价是潜在性能上限较低。视觉 Transformer(ViT)依赖更灵活的自注意力层,近期在图像分类上超越了 CNN。然而,它们需要在大型外部数据集上昂贵的预训练或从预训练卷积网络蒸馏。在本文中,我们提出如下问题:能否结合这两种架构的优势,同时避免各自的局限?为此,我们引入门控位置自注意力(GPSA),一种可配备“软”卷积归纳偏置的位置自注意力形式。我们将 GPSA 层初始化以模仿卷积层的局部性,然后赋予每个注意力头通过调整调节位置与内容信息注意力的门控参数来逃离局部性的自由。由此产生的类卷积 ViT 架构 ConViT 在 ImageNet 上优于 DeiT,同时提供了大幅改善的样本效率。我们进一步通过首先量化 vanilla 自注意力层中局部性如何被鼓励,然后分析 GPSA 层中如何逃离局部性,来研究局部性在学习中的作用。最后我们通过多种消融实验更好地理解 ConViT 的成功。我们的代码与模型已公开发布于 https://github.com/facebookresearch/convit。
引用
@article{arxiv.2103.10697,
title = {ConViT: Improving Vision Transformers with Soft Convolutional Inductive Biases},
author = {Stéphane d'Ascoli and Hugo Touvron and Matthew Leavitt and Ari Morcos and Giulio Biroli and Levent Sagun},
journal= {arXiv preprint arXiv:2103.10697},
year = {2022}
}