中文

眼中的动作:用于视觉识别的动态眼动数据集与学习显著性模型

计算机视觉与模式识别 2013-12-31 v1

摘要

基于从稀疏兴趣点算子极大值处收集的图像特征的词袋模型系统,已成功用于计算机视觉对象和动作识别任务。虽然基于稀疏兴趣点的识别方法与在“扫视与注视”模式下运作的生物系统中的视觉处理并不矛盾,但人类视觉与计算机视觉社区在方法和侧重点上仍然存在显著差异。在此,我们为弥合这一差距做出了三项贡献。首先,我们用视觉动作识别任务的生态约束下收集的人类眼动数据,补充了现有最先进的大规模动态计算机视觉标注数据集(如Hollywood-2和UCF Sports)。据我们所知,这些是首批为视频收集并公开发布的大规模人类眼动追踪数据集,vision.imar.ro/eyetracking(497,107帧,每帧由16名受试者观看),其独特性在于具有以下特点:大规模和计算机视觉相关性;动态视频刺激;任务控制而非自由观看。其次,我们引入了新的序列一致性与对齐度量,突显了受试者之间视觉搜索模式的显著稳定性。第三,我们利用收集到的大量数据,开展研究并构建基于人类眼动的自动、端到端可训练计算机视觉系统。我们的研究不仅揭示了计算机视觉时空兴趣点图像采样策略与人类注视之间的差异及其对视觉识别性能的影响,还证明了人类注视可以被准确预测,并且在端到端自动系统中利用一些先进的计算机视觉实践时,可以取得最先进的结果。

关键词

引用

@article{arxiv.1312.7570,
  title  = {Actions in the Eye: Dynamic Gaze Datasets and Learnt Saliency Models for Visual Recognition},
  author = {Stefan Mathe and Cristian Sminchisescu},
  journal= {arXiv preprint arXiv:1312.7570},
  year   = {2013}
}