中文

从视频眼动数据学习时间相关的主显著图

计算机视觉与模式识别 2017-02-03 v1

摘要

为预测复杂自然场景中最显著的区域,显著模型通常计算若干特征图(对比度、方向、运动……)并将其线性组合为主显著图。由于特征图具有不同的空间分布和幅度动态范围,确定它们对整体显著性的贡献仍是一个开放问题。大多数最先进的模型不考虑时间,并在刺激持续期间给特征图恒定权重。然而,视觉探索是一个高度动态的过程,受许多时间相关因素塑造。例如,某些系统性观看模式如中心偏置已知在探索的时间过程中剧烈变化。本文中,我们使用最大似然和收缩方法,直接从视频上记录的眼动数据动态且联合地学习特征图和系统性观看模式权重。我们表明这些权重作为时间的函数系统性变化,并且严重依赖于所处理视频的语义视觉类别。我们的融合方法允许考虑这些变异,并且优于其他随时间使用恒定权重的先进融合方案。我们用于本研究的代码、视频和眼动数据可在线获取:http://antoinecoutrot.magix.net/public/research.html

关键词

引用

@article{arxiv.1702.00714,
  title  = {Learning a time-dependent master saliency map from eye-tracking data in videos},
  author = {Antoine Coutrot and Nathalie Guyader},
  journal= {arXiv preprint arXiv:1702.00714},
  year   = {2017}
}