将卷积核扩展到 31x31:重新审视 CNN 中的大卷积核设计
计算机视觉与模式识别
2022-04-05 v4 人工智能
机器学习
摘要
我们重新审视现代卷积神经网络(CNN)中的大卷积核设计。受视觉Transformer(ViT)近期进展的启发,本文中我们证明,使用少量大卷积核而非堆叠多个小卷积核可能是一种更强大的范式。我们提出了五条准则,例如应用重参数化的大深度可分离卷积,以设计高效高性能的大卷积核 CNN。遵循这些准则,我们提出了 RepLKNet,一种纯 CNN 架构,其卷积核尺寸大至 31x31,而非常用的 3x3。RepLKNet 极大地缩小了 CNN 与 ViT 之间的性能差距,例如在 ImageNet 和若干典型下游任务上取得与 Swin Transformer 相当或更优的结果,且延迟更低。RepLKNet 还展现出对大数据和大模型的良好可扩展性,在 ImageNet 上取得 87.8% 的 top-1 准确率,在 ADE20K 上取得 56.0% 的 mIoU,在与类似模型尺寸的最先进方法相比中极具竞争力。我们的研究进一步揭示,与小卷积核 CNN 不同,大卷积核 CNN 具有大得多的有效感受野以及更高的形状偏置而非纹理偏置。代码与模型见 https://github.com/megvii-research/RepLKNet。
引用
@article{arxiv.2203.06717,
title = {Scaling Up Your Kernels to 31x31: Revisiting Large Kernel Design in CNNs},
author = {Xiaohan Ding and Xiangyu Zhang and Yizhuang Zhou and Jungong Han and Guiguang Ding and Jian Sun},
journal= {arXiv preprint arXiv:2203.06717},
year = {2022}
}
备注
Accepted by CVPR 2022