中文

通过最大池化膨胀量化并诱导 CNN 中的形状偏置

计算机视觉与模式识别 2026-02-06 v2 机器学习

摘要

卷积神经网络(CNNs)表现出一种 well-known 的纹理偏置,优先考虑局部模式而非全局形状——这是一种固有的CNN结构所固有的倾向。虽然这种偏置对纹理丰富的自然图像有益,但往往会降低在插图和草图等以形状为主导的数据上的性能。虽然已有工作提出了面向纹理偏置的模型以缓解此问题,但这些方法缺乏用于识别哪些数据集实际上会受益于此类修改的量化度量标准。为此,我们提出一种数据驱动的度量方法,通过计算图像亮度(Y)通道与其 L0 平滑版本之间的结构相似性指数(SSIM),来量化数据集中形状-纹理平衡。基于此度量,我们引入一种计算效率高的适应方法,通过修改最大池化操作的膨胀量来促进形状偏置,同时保持卷积权重冻结。实验结果表明,在形状主导数据集上实现一致的准确率提升,尤其是在数据有限且不实用进行完整微调的情况下,只需训练最终分类层即可实现。

关键词

引用

@article{arxiv.2601.05599,
  title  = {Quantifying and Inducing Shape Bias in CNNs via Max-Pool Dilation},
  author = {Takito Sawada and Akinori Iwata and Masahiro Okuda},
  journal= {arXiv preprint arXiv:2601.05599},
  year   = {2026}
}

备注

Accepted to IEVC 2026. 4 pages, 1 figure, 3 tables