中文

ImageNet 训练的 CNN 偏向纹理;增强形状偏向可提升准确率与鲁棒性

计算机视觉与模式识别 2022-11-11 v3 人工智能 机器学习 神经元与认知 机器学习

摘要

卷积神经网络(CNNs)通常被认为是通过学习日益复杂的物体形状表征来识别物体。一些近期研究暗示图像纹理起着更重要的作用。我们在此通过对具有纹理-形状线索冲突的图像评估 CNN 与人类观察者,对这些相互冲突的假设进行定量检验。我们表明,ImageNet 训练的 CNN 强烈偏向于识别纹理而非形状,这与人类行为证据形成鲜明对比,并揭示了根本不同的分类策略。我们随后证明,在 ImageNet 上学习基于纹理表征的同一标准架构(ResNet-50),当在 ImageNet 的风格化版本“Stylized-ImageNet”上训练时,能够转而学习基于形状的表征。这在我们的受控心理物理实验室环境(九项实验,共 97 名观察者、48,560 次心理物理试验)中更好地契合人类行为表现,并带来若干意想不到的涌现益处,例如改进的物体检测性能以及对大范围图像失真前所未有的鲁棒性,凸显了基于形状表征的优势。

关键词

引用

@article{arxiv.1811.12231,
  title  = {ImageNet-trained CNNs are biased towards texture; increasing shape bias improves accuracy and robustness},
  author = {Robert Geirhos and Patricia Rubisch and Claudio Michaelis and Matthias Bethge and Felix A. Wichmann and Wieland Brendel},
  journal= {arXiv preprint arXiv:1811.12231},
  year   = {2022}
}

备注

Accepted at ICLR 2019 (oral)