CoAtNet:融合卷积与注意力机制以适配各种数据规模
计算机视觉与模式识别
2021-09-16 v2 机器学习
摘要
Transformer 在计算机视觉中引起了越来越多的关注,但它们仍然落后于最先进的卷积网络。在这项工作中,我们表明,虽然 Transformer 往往具有更大的模型容量,但由于缺乏正确的归纳偏置,其泛化能力可能不如卷积网络。为了有效结合两种架构的优势,我们提出了 CoAtNets(读作“coat” nets),这是一个由两项关键见解构建的混合模型族:(1) 深度卷积(depthwise Convolution)与自注意力(self-Attention)可以通过简单的相对注意力自然统一;(2) 以原则性方式垂直堆叠卷积层与注意力层,在提升泛化能力、容量和效率方面出奇地有效。实验表明,我们的 CoAtNets 在不同资源约束下的各种数据集中均取得了最先进的性能:在无额外数据的情况下,CoAtNet 取得了 86.0% 的 ImageNet top-1 准确率;当使用来自 ImageNet-21K 的 13M 图像进行预训练时,我们的 CoAtNet 取得了 88.56% 的 top-1 准确率,与使用来自 JFT-300M 的 300M 图像预训练的 ViT-huge 相当,同时仅使用了 1/23 的数据量;值得注意的是,当我们进一步使用 JFT-3B 扩展 CoAtNet 时,它在 ImageNet 上取得了 90.88% 的 top-1 准确率,确立了新的最先进结果。
引用
@article{arxiv.2106.04803,
title = {CoAtNet: Marrying Convolution and Attention for All Data Sizes},
author = {Zihang Dai and Hanxiao Liu and Quoc V. Le and Mingxing Tan},
journal= {arXiv preprint arXiv:2106.04803},
year = {2021}
}