2020 年代的更多卷积网络:利用稀疏性将核放大至 51x51 以上
计算机视觉与模式识别
2023-03-07 v3
摘要
自 Vision Transformers(ViTs)出现以来,Transformer 迅速在计算机视觉领域大放异彩。卷积神经网络(CNNs)的主导地位似乎受到日益有效的基于 Transformer 模型的挑战。最近,若干先进卷积模型受局部窗口注意力机制启发,以大核反击,展现出令人瞩目的性能与效率。其中 RepLKNet 令人印象深刻地可将核大小扩展至 31x31 并提升性能,但相较于 Swin Transformer 等先进 ViTs 的扩展趋势,性能随核继续增大开始饱和。本文探索训练大于 31x31 的极端卷积的可能性,并检验性能差距能否通过策略性放大卷积消除。本研究最终给出从稀疏性角度应用超大核的方案,可平滑将核放大至 61x61 且性能更优。基于此方案,我们提出稀疏大核网络(SLaK),一种配备稀疏分解 51x51 核的纯 CNN 架构,在 ImageNet 分类以及广泛下游任务(包括 ADE20K 语义分割、PASCAL VOC 2007 目标检测、MS COCO 目标检测/分割)上,性能可与 SOTA 分层 Transformer 及 ConvNeXt、RepLKNet 等现代 ConvNet 架构持平或更优。
引用
@article{arxiv.2207.03620,
title = {More ConvNets in the 2020s: Scaling up Kernels Beyond 51x51 using Sparsity},
author = {Shiwei Liu and Tianlong Chen and Xiaohan Chen and Xuxi Chen and Qiao Xiao and Boqian Wu and Tommi Kärkkäinen and Mykola Pechenizkiy and Decebal Mocanu and Zhangyang Wang},
journal= {arXiv preprint arXiv:2207.03620},
year = {2023}
}
备注
Preprint