中文

ConvNeXt V2:基于掩码自编码器的卷积网络协同设计与扩展

计算机视觉与模式识别 2023-01-03 v1

摘要

在改进的架构和更好的表示学习框架的推动下,视觉识别领域在 2020 年代早期经历了快速的现代化和性能提升。例如,以 ConvNeXt 为代表的现代卷积网络在各种场景中展现了强劲性能。虽然这些模型最初是为使用 ImageNet 标签的监督学习而设计的,它们也可能从掩码自编码器(MAE)等自监督学习技术中受益。然而,我们发现简单地将这两种方法结合会导致欠佳的性能。在本文中,我们提出了一种全卷积掩码自编码器框架和一种新的全局响应归一化(GRN)层,该层可添加到 ConvNeXt 架构中以增强通道间特征竞争。这种自监督学习技术与架构改进的协同设计产生了称为 ConvNeXt V2 的新模型族,其显著提升了纯卷积网络在各种识别基准上的性能,包括 ImageNet 分类、COCO 检测和 ADE20K 分割。我们还提供了不同规模的预训练 ConvNeXt V2 模型,从在 ImageNet 上达到 76.7% top-1 准确率的高效 3.7M 参数 Atto 模型,到仅使用公开训练数据便达到最先进 88.9% 准确率的 650M Huge 模型。

关键词

引用

@article{arxiv.2301.00808,
  title  = {ConvNeXt V2: Co-designing and Scaling ConvNets with Masked Autoencoders},
  author = {Sanghyun Woo and Shoubhik Debnath and Ronghang Hu and Xinlei Chen and Zhuang Liu and In So Kweon and Saining Xie},
  journal= {arXiv preprint arXiv:2301.00808},
  year   = {2023}
}

备注

Code and models available at https://github.com/facebookresearch/ConvNeXt-V2