InternImage:利用可变形卷积探索大规模视觉基础模型
计算机视觉与模式识别
2023-04-18 v4
摘要
与近年来大规模视觉 Transformer(ViT)的巨大进展相比,基于卷积神经网络(CNN)的大规模模型仍处于早期状态。本工作提出了一种新型的基于 CNN 的大规模基础模型,称为 InternImage,它可以像 ViT 一样从参数和训练数据的增加而获得收益。与近期关注大密集核的 CNN 不同,InternImage 以可变形卷积为核心算子,因此我们的模型不仅具有检测和分割等下游任务所需的大有效感受野,还具有由输入和任务信息所调节的自适应空间聚合能力。结果,所提出的 InternImage 减少了传统 CNN 严格的归纳偏置,并使得像 ViT 一样从海量数据中用大规模参数学习更强健、更鲁棒的模式成为可能。我们模型的有效性在包括 ImageNet、COCO 和 ADE20K 在内的具有挑战性的基准上得到验证。值得一提的是,InternImage-H 在 COCO test-dev 上取得了 65.4 mAP 的新纪录,在 ADE20K 上取得了 62.9 mIoU,优于当前领先的 CNN 和 ViT。代码将在 https://github.com/OpenGVLab/InternImage 发布。
引用
@article{arxiv.2211.05778,
title = {InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions},
author = {Wenhai Wang and Jifeng Dai and Zhe Chen and Zhenhang Huang and Zhiqi Li and Xizhou Zhu and Xiaowei Hu and Tong Lu and Lewei Lu and Hongsheng Li and Xiaogang Wang and Yu Qiao},
journal= {arXiv preprint arXiv:2211.05778},
year = {2023}
}
备注
Accepted to CVPR 2023