中文

人类视觉系统与 CNN 在极端位移后均能支持稳健的在线平移容限

神经元与认知 2020-12-09 v2

摘要

视觉平移容限指的是我们在广泛不同视网膜位置上识别物体的能力。尽管平移或许是视觉系统需要应对的最简单空间变换,但人类视觉系统在先前未见位置上识别物体的程度尚不清楚,一些研究报道在 10{\deg} 内近乎完全不变性,而另一些则报道在 4{\deg} 视角下零不变性。类似地,关于视觉计算模型的平移容限程度以及人类与模型性能之间的匹配程度也存在混淆。本文报道了一系列眼动追踪研究(总 N=70),表明在一个视网膜位置训练的新异物体可在平移至多 18{\deg} 后以保持高准确率被识别。我们还表明,标准深度卷积网络(DCNNs)在预训练以跨一系列位置分类另一组刺激时,或当添加全局平均池化(GAP)层以产生更大感受野时,支持我们的发现。我们的发现为人类视觉理论提供了强约束,并有助于解释先前在 CNN 中报道的不一致结果。

关键词

引用

@article{arxiv.2009.12855,
  title  = {The human visual system and CNNs can both support robust online translation tolerance following extreme displacements},
  author = {Ryan Blything and Valerio Biscione and Ivan I. Vankov and Casimir J. H. Ludwig and Jeffrey S. Bowers},
  journal= {arXiv preprint arXiv:2009.12855},
  year   = {2020}
}

备注

Main manuscript contains 5 figures plus 2 tables. SI contains 2 tables