全局池化,不止所见:位置信息在 CNN 中按通道维度编码
计算机视觉与模式识别
2021-08-19 v1
摘要
在本文中,我们挑战了一个常见假设,即通过全局池化将卷积神经网络(CNN)中一个三维(空间-通道)张量的空间维度压缩为一个向量会移除所有空间信息。具体而言,我们证明了位置信息是基于通道维度的顺序进行编码的,而语义信息在很大程度上并非如此。在证明之后,我们通过将其应用于两个场景来展示这些发现的现实影响。首先,我们提出了一种简单而有效的数据增强策略和损失函数,提升了 CNN 输出的平移不变性。其次,我们提出了一种高效确定隐表示中哪些通道负责(i)编码整体位置信息或(ii)区域特定位置的方法。我们首先表明语义分割在做出预测时显著依赖于整体位置通道。然后我们首次展示,执行一种“区域特定”攻击并降低网络在输入特定部分的表现是可能的。我们相信我们的发现和所展示的应用将有益于关注理解 CNN 特性的研究领域。
引用
@article{arxiv.2108.07884,
title = {Global Pooling, More than Meets the Eye: Position Information is Encoded Channel-Wise in CNNs},
author = {Md Amirul Islam and Matthew Kowal and Sen Jia and Konstantinos G. Derpanis and Neil D. B. Bruce},
journal= {arXiv preprint arXiv:2108.07884},
year = {2021}
}
备注
ICCV 2021