中文

用于基于视频的显著性目标检测的基准数据集与显著性引导堆叠自编码器

计算机视觉与模式识别 2017-05-10 v2

摘要

基于图像的显著性目标检测(SOD)在过去几十年中得到了广泛研究。然而,基于视频的 SOD 探索较少,因为缺乏大规模视频数据集来明确界定和标注显著性物体。为此,本文提出了一个基于视频的 SOD 数据集,包含 200 个视频(64 分钟)。在构建数据集时,我们手动标注了 7,650 个均匀采样关键帧上的所有物体和区域,并收集了 23 名受试者自由观看所有视频的眼动追踪数据。从用户数据中,我们发现视频中的显著性物体可定义为在整个视频中持续突显的物体,并且具有此类属性的物体可通过结合手动标注的物体/区域掩码与多名受试者的眼动追踪数据来明确标注。据我们所知,这是目前最大的基于视频的显著性目标检测数据集。基于该数据集,本文提出一种利用显著性引导堆叠自编码器的无监督基线方法用于基于视频的 SOD。在所提方法中,首先在像素、超像素和物体级别提取多种时空显著性线索。利用这些显著性线索,无监督地构建堆叠自编码器,通过逐步编码从像素及其时空邻域收集的高维显著性线索,自动推断每个像素的显著性分数。实验结果表明,所提出的无监督方法在提出的数据集上优于 30 个最先进模型,包括 19 个基于图像与经典的(无监督或非深度学习)、6 个基于图像与深度学习的以及 5 个基于视频与无监督的。此外,基准测试结果表明,所提数据集极具挑战性,并有可能推动基于视频的 SOD 的发展。

关键词

引用

@article{arxiv.1611.00135,
  title  = {A Benchmark Dataset and Saliency-guided Stacked Autoencoders for Video-based Salient Object Detection},
  author = {Jia Li and Changqun Xia and Xiaowu Chen},
  journal= {arXiv preprint arXiv:1611.00135},
  year   = {2017}
}