中文

DeepGaze II:从基于物体识别训练的深度特征中解读注视点

计算机视觉与模式识别 2016-10-06 v1 神经元与认知 应用统计

摘要

本文提出 DeepGaze II,一个预测人们在图像中注视位置的模型。该模型使用经过训练以识别图像中物体的 VGG-19 深度神经网络的特征。与其他使用深度特征的显著性模型不同,我们在此直接使用 VGG 特征进行显著性预测,无需额外的微调(而是在 VGG 特征之上训练少数几个读出层来预测显著性)。因此,该模型是对迁移学习的一个有力检验。经过保守的交叉验证,DeepGaze II 解释了注视点模式中约 87% 的可解释信息增益,并在 MIT300 留出基准测试的曲线下面积指标上取得了顶尖性能。这些结果证实了 DeepGaze I(解释了 56% 的可解释信息增益)的发现,即基于物体识别训练的深度特征为执行相关的视觉任务提供了一个通用的特征空间。我们探讨了促成这一成功的因素,并展示了若干信息性图像示例。可通过 http://deepgaze.bethgelab.org 上的网络服务计算模型预测。

关键词

引用

@article{arxiv.1610.01563,
  title  = {DeepGaze II: Reading fixations from deep features trained on object recognition},
  author = {Matthias Kümmerer and Thomas S. A. Wallis and Matthias Bethge},
  journal= {arXiv preprint arXiv:1610.01563},
  year   = {2016}
}