中文

不再使用步幅卷积或池化:一种面向低分辨率图像与小物体的新 CNN 构建模块

计算机视觉与模式识别 2022-08-09 v1 机器学习

摘要

卷积神经网络(CNN)在许多计算机视觉任务(如图像分类和目标检测)中取得了巨大成功。然而,在图像分辨率低或物体小的更困难任务上,其性能迅速下降。本文指出,这源于现有 CNN 架构中一个存在缺陷却常见的设计,即使用步幅卷积和/或池化层,导致细粒度信息丢失并学到有效性较低的特征表示。为此,我们提出一种新的 CNN 构建模块 SPD-Conv 来替代每一个步幅卷积层和每一个池化层(从而彻底消除它们)。SPD-Conv 由一个空间到深度(SPD)层后接一个非步幅卷积(Conv)层组成,可应用于绝大多数(即便不是全部)CNN 架构。我们在两个最具代表性的计算机视觉任务(目标检测和图像分类)下阐释了这一新设计。随后通过将 SPD-Conv 应用于 YOLOv5 和 ResNet 创建了新的 CNN 架构,并实证表明我们的方法显著优于最先进的深度学习模型,尤其是在具有低分辨率图像和小物体的更困难任务上。我们已在 https://github.com/LabSAINT/SPD-Conv 开源代码。

关键词

引用

@article{arxiv.2208.03641,
  title  = {No More Strided Convolutions or Pooling: A New CNN Building Block for Low-Resolution Images and Small Objects},
  author = {Raja Sunkara and Tie Luo},
  journal= {arXiv preprint arXiv:2208.03641},
  year   = {2022}
}

备注

European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML PKDD), 2022