面向 2020 年代的 ConvNet
计算机视觉与模式识别
2022-03-03 v2
摘要
视觉识别的“咆哮的 20 年代”始于 Vision Transformers (ViTs) 的引入,其迅速取代 ConvNets 成为最先进的图像分类模型。另一方面,朴素 ViT 在应用于目标检测与语义分割等通用计算机视觉任务时面临困难。正是分层 Transformer(如 Swin Transformers)重新引入了若干 ConvNet 先验,使 Transformer 作为通用视觉骨干实际可行,并在广泛视觉任务上展现出卓越性能。然而,此类混合方法的有效性仍主要归功于 Transformer 的内在优越性,而非卷积固有的归纳偏置。本工作中,我们重新审视设计空间并测试纯 ConvNet 所能达到的极限。我们将标准 ResNet 逐步“现代化”至视觉 Transformer 的设计,并沿途发现若干导致性能差异的关键组件。该探索的成果是一族称为 ConvNeXt 的纯 ConvNet 模型。ConvNeXts 完全由标准 ConvNet 模块构建,在准确率与可扩展性上可与 Transformer 媲美,取得 87.8% ImageNet top-1 准确率,并在 COCO 检测与 ADE20K 分割上超越 Swin Transformers,同时保持标准 ConvNets 的简洁与高效。
引用
@article{arxiv.2201.03545,
title = {A ConvNet for the 2020s},
author = {Zhuang Liu and Hanzi Mao and Chao-Yuan Wu and Christoph Feichtenhofer and Trevor Darrell and Saining Xie},
journal= {arXiv preprint arXiv:2201.03545},
year = {2022}
}
备注
CVPR 2022; Code: https://github.com/facebookresearch/ConvNeXt