中文

具有可学习间隔的膨胀卷积

计算机视觉与模式识别 2023-05-12 v4 人工智能 神经与进化计算

摘要

近期工作表明,卷积神经网络(CNN)需要大感受野(RF)才能与视觉 transformer 及其注意力机制竞争。在 CNN 中,RF 可通过增大卷积核尺寸简单扩大。然而可训练参数数量在二维情形下随核尺寸平方增长,迅速变得难以承受,且训练 notoriously 困难。本文提出一种不增加参数数量即可增大 RF 尺寸的新方法。膨胀卷积(DC)已为同一目的被提出。DC 可看作仅含少量按规则网格放置的非零元素的卷积核的卷积。此处我们提出 DC 的新版本,其中非零元素之间的间隔,或等价地其位置,不再固定,而是借助插值技术通过反向传播可学习。我们称该方法为“具有可学习间隔的膨胀卷积”(DCLS),并将其推广到 n 维卷积情形。不过,我们此处主要关注二维情形。我们首先在 ResNet50 上尝试该方法:将标准卷积替换为 DCLS 卷积,在等参数下提升了 ImageNet1k 分类准确率,但牺牲了吞吐量。接着,我们使用近期最先进的卷积架构 ConvNeXt,并将深度可分离卷积替换为 DCLS 卷积。这不仅提升了 ImageNet1k 分类准确率,也提升了典型下游与鲁棒性任务的准确率,同样在等参数下,且此次吞吐量代价可忽略,因为 ConvNeXt 使用可分离卷积。相反,经典 DC 在 ResNet50 和 ConvNeXt 上均导致较差性能。方法代码见:https://github.com/K-H-Ismail/Dilated-Convolution-with-Learnable-Spacings-PyTorch。

关键词

引用

@article{arxiv.2112.03740,
  title  = {Dilated convolution with learnable spacings},
  author = {Ismail Khalfaoui-Hassani and Thomas Pellegrini and Timothée Masquelier},
  journal= {arXiv preprint arXiv:2112.03740},
  year   = {2023}
}

备注

Published in The Eleventh International Conference on Learning Representations (ICLR) 2023. (https://openreview.net/forum?id=Q3-1vRh3HOA)