中文

人类与深度网络在哪些变化使物体识别更难上大体一致

计算机视觉与模式识别 2016-09-13 v1 神经元与认知

摘要

视角不变物体识别是一个具有挑战性的问题,引起了心理学、神经科学以及计算机视觉界的广泛关注。人类在此方面出奇地擅长,尽管某些变化可能比其他变化更难处理(例如三维旋转)。认为人类通过沿腹侧流的分层处理解决该问题,逐步提取出越来越具有不变性的视觉特征。这种前馈架构启发了新一代受生物启发的计算机视觉系统,称为深度卷积神经网络(DCNN),其目前是自然图像中物体识别的最佳算法。在此,我们首次使用相同图像并控制变换种类及其幅度,系统比较了人类前馈视觉与DCNN在视角不变物体识别上的表现。我们使用了四个物体类别,图像由三维计算机模型渲染生成。共有89名人类受试者参与了10项实验,他们需在快速呈现并后向掩蔽后区分两个或四个类别。我们还在相同任务上测试了两个近期DCNN。我们发现,人类与DCNN对各种变化的相对难度大体一致:深度旋转迄今为止是最难处理的变换,其次是尺度,然后是平面内旋转,最后是位置。这表明人类主要通过二维模板匹配来识别物体,而非通过构建三维物体模型,且DCNN作为人类前馈视觉的模型并非不合理。此外,我们的结果显示深度旋转和尺度的变化水平强烈调节人类与DCNN的识别性能。因此我们主张,在视觉研究使用的图像数据集中应控制这些变化。

关键词

引用

@article{arxiv.1604.06486,
  title  = {Humans and deep networks largely agree on which kinds of variation make object recognition harder},
  author = {Saeed Reza Kheradpisheh and Masoud Ghodrati and Mohammad Ganjtabesh and Timothée Masquelier},
  journal= {arXiv preprint arXiv:1604.06486},
  year   = {2016}
}