中文

金字塔卷积:重新思考用于视觉识别的卷积神经网络

计算机视觉与模式识别 2020-06-23 v1 机器学习 图像与视频处理

摘要

本工作提出金字塔卷积(PyConv),其能够在多个滤波器尺度上处理输入。PyConv 包含一层内核金字塔,其中每一层涉及不同大小与深度的各类滤波器,能够捕捉场景中不同层次的细节。除了这些改进的认知能力外,PyConv 还很高效,并且根据我们的公式,与标准卷积相比不会增加计算成本和参数量。此外,它非常灵活且可扩展,为不同应用提供了庞大的潜在网络架构空间。PyConv 有潜力影响几乎每一项计算机视觉任务,在本工作中,我们基于 PyConv 提出了用于视觉识别中四项主要任务的不同架构:图像分类、视频动作分类/识别、目标检测与语义图像分割/解析。与基线相比,我们的方法在所有这些核心任务上均显示出显著改进。例如,在图像识别上,我们的 50 层网络在 ImageNet 数据集上的识别性能优于其对应的 152 层基线 ResNet,同时参数量少 2.39 倍、计算复杂度低 2.52 倍且层数少 3 倍以上。在图像分割上,我们的新框架在具有挑战性的 ADE20K 场景解析基准上确立了新的 SOTA。代码见:https://github.com/iduta/pyconv

关键词

引用

@article{arxiv.2006.11538,
  title  = {Pyramidal Convolution: Rethinking Convolutional Neural Networks for Visual Recognition},
  author = {Ionut Cosmin Duta and Li Liu and Fan Zhu and Ling Shao},
  journal= {arXiv preprint arXiv:2006.11538},
  year   = {2020}
}