中文

补丁就是你所需要的一切?

计算机视觉与模式识别 2022-01-25 v1 人工智能 机器学习

摘要

尽管卷积网络多年来一直是视觉任务的主导架构,但最近的实验表明,基于 Transformer 的模型,尤其是 Vision Transformer (ViT),在某些情况下可能超越其性能。然而,由于 Transformer 中自注意力层的平方时间复杂度,ViT 需要使用补丁嵌入(将图像的小区域组合成单个输入特征),以便应用于更大的图像尺寸。这引发了一个问题:ViT 的性能是由于其本质上更强大的 Transformer 架构,还是至少部分归因于使用补丁作为输入表示?在本文中,我们为后者提供了一些证据:具体来说,我们提出了 ConvMixer,这是一个极其简单的模型,其精神类似于 ViT 和更基础的 MLP-Mixer,因为它直接在补丁上操作作为输入,分离了空间和通道维度的混合,并在整个网络中保持相同的大小和分辨率。然而,相比之下,ConvMixer 仅使用标准卷积来实现混合步骤。尽管其简单,我们表明,在相似的参数数量和数据集大小下,ConvMixer 的性能优于 ViT、MLP-Mixer 及其一些变体,此外还优于经典的视觉模型,如 ResNet。我们的代码可在 https://github.com/locuslab/convmixer 获取。

关键词

引用

@article{arxiv.2201.09792,
  title  = {Patches Are All You Need?},
  author = {Asher Trockman and J. Zico Kolter},
  journal= {arXiv preprint arXiv:2201.09792},
  year   = {2022}
}