位置、填充与预测:深入考察 CNN 中的位置信息
计算机视觉与模式识别
2021-02-01 v1
摘要
与全连接网络不同,卷积神经网络(CNNs)通过学习与有限空间范围的局部滤波器相关联的权重来实现效率。其一个含义是,滤波器可能知道它在看什么,但不知道它在图像中的位置。在本文中,我们首先检验这一假设,并揭示在常用 CNN 中编码了惊人程度的绝对位置信息。我们表明零填充(zero padding)驱动 CNN 在其内部表示中编码位置信息,而缺乏填充则排除位置编码。这引发了关于 CNN 中位置信息作用的更深层次问题:(i) 何种边界启发式能为下游任务实现最优位置编码?;(ii) 位置编码是否影响语义表示的学习?;(iii) 位置编码是否总是提升性能?为提供解答,我们开展了迄今为止关于填充与边界启发式在 CNN 中所起作用的最大案例研究。我们设计了新颖任务,使我们能够量化作为到边界距离函数的边界效应。众多语义目标揭示了边界对语义表示的影响。最后,我们展示了这些发现对多个真实世界任务的影响,表明位置信息既可能帮助也可能损害性能。
引用
@article{arxiv.2101.12322,
title = {Position, Padding and Predictions: A Deeper Look at Position Information in CNNs},
author = {Md Amirul Islam and Matthew Kowal and Sen Jia and Konstantinos G. Derpanis and Neil D. B. Bruce},
journal= {arXiv preprint arXiv:2101.12322},
year = {2021}
}