视觉搜索不对称性:深度网络与人类共享相似的固有偏置
计算机视觉与模式识别
2021-11-09 v2 神经元与认知
摘要
视觉搜索是一项普遍且常具挑战性的日常任务,例如在家中寻找车钥匙或在人群中寻找朋友。某些经典搜索任务的一个有趣特性是不对称性:在干扰项B中寻找目标A可能比在A中寻找B更容易。为阐明视觉搜索中不对称性背后的机制,我们提出一个计算模型,该模型以目标与搜索图像为输入,并生成一系列眼动直至找到目标。该模型将依赖于离心度的视觉识别与依赖于目标的自上而下线索相整合。我们在六项展现人类不对称性的范式性搜索任务中将模型与人类行为进行比较。无需事先接触刺激或任务特定训练,该模型为搜索不对称性提供了合理机制。我们假设搜索不对称性的极性源于对自然环境的经验。我们通过在ImageNet的增强版本上训练模型来检验该假设,其中自然图像的偏置被移除或反转。搜索不对称性的极性根据训练方案消失或改变。本研究凸显了经典感知特性如何在神经网络模型中涌现,无需任务特定训练,而是作为喂给模型的发育期数据统计特性的后果。所有源代码与数据公开于 https://github.com/kreimanlab/VisualSearchAsymmetry。
引用
@article{arxiv.2106.02953,
title = {Visual Search Asymmetry: Deep Nets and Humans Share Similar Inherent Biases},
author = {Shashi Kant Gupta and Mengmi Zhang and Chia-Chien Wu and Jeremy M. Wolfe and Gabriel Kreiman},
journal= {arXiv preprint arXiv:2106.02953},
year = {2021}
}
备注
Neural Information Processing Systems (NeurIPS) 2021