中文

通过低分辨率注视学习原对象表示

计算机视觉与模式识别 2014-12-30 v2

摘要

虽然以往的眼动注视预测研究通常依赖于整合低级特征(如颜色、边缘)来构建显著图,但最近发现将这些特征的结构组织成原对象(proto-object)表示可以发挥更重要的作用。在本文中,我们提出了一种基于深度网络的计算框架,以证明可以从注视区域的低分辨率图像块中学习原对象表示。我们在本工作中主张使用低分辨率输入,原因如下:(1) 原对象是在整个视野上并行计算的;(2) 即使处于低分辨率,人们也能很好地感知或识别物体;(3) 来自低分辨率图像的注视可以预测高分辨率图像上的注视。在提出的计算模型中,我们从眼动注视数据集中提取注视区域的多尺度图像块,将其调整为低分辨率并输入到分层网络中。通过逐层无监督特征学习,我们发现学习出了许多类似原对象的特征,这些特征对不同形状的物体团块具有响应。可视化结果也表明,这些特征对场景中的潜在物体具有选择性,并且当与学习到的权重结合时,这些特征的响应能很好地预测图像上的眼动注视。

关键词

引用

@article{arxiv.1412.7242,
  title  = {Learning of Proto-object Representations via Fixations on Low Resolution},
  author = {Chengyao Shen and Xun Huang and Qi Zhao},
  journal= {arXiv preprint arXiv:1412.7242},
  year   = {2014}
}

备注

This paper has been withdrawn by the author due to incompletion of the submission