中文

基于小波卷积的大感受野

计算机视觉与模式识别 2024-07-16 v2

摘要

近年来,人们尝试增大卷积神经网络(CNN)的卷积核大小,以模拟视觉转换器(ViT)自注意力块的全局感受野。但这种方法很快遇到上限,在未实现全局感受野前就饱和。本文展示了通过利用小波变换(WT),实际上可以获得非常大的感受野,而不会出现参数膨胀,例如对于 k×kk \times k 的感受野,本文方法中可训练参数的数量仅随 kk 的 logarithm 增长。提出的层称为 WTConv,可作为现有架构中的即插即用替换,结果产生有效的多频率响应,并且随感受野大小的增大而顺畅扩展。我们在 ConvNeXt 和 MobileNetV2 架构中演示了 WTConv 层在图像分类以及下游任务中的有效性,并展示它具有鲁棒性(对图像损坏的鲁棒性)以及对形状而非纹理的响应增强等附加属性。我们的代码已公开于 https://github.com/BGU-CS-VIL/WTConv。

关键词

引用

@article{arxiv.2407.05848,
  title  = {Wavelet Convolutions for Large Receptive Fields},
  author = {Shahaf E. Finder and Roy Amoyal and Eran Treister and Oren Freifeld},
  journal= {arXiv preprint arXiv:2407.05848},
  year   = {2024}
}

备注

Accepted to ECCV 2024