中文

自然视频显著性预测的深度学习

计算机视觉与模式识别 2016-04-28 v1

摘要

本文旨在利用新的深度学习技术检测自然视频中的显著区域。首先预测视频帧中的显著块,然后在此基础上构建预测的视觉注视图。我们基于使用Caffe工具包实现的CaffeNet设计深度架构。结果表明,通过改变用于优化网络参数的数据选择方式,最多可节省12倍计算成本。我们利用人类视觉系统对残差运动的敏感性,将针对RGB值的静态图像显著性预测的深度学习方法扩展到视频的特性上。此外,我们通过经典视觉注意预测模型中提出的对比特征来补充原色像素值。实验在两个公开数据集上进行。第一个是IRCCYN视频数据库,包含31个视频,共计7300帧和37名受试者的眼动注视点。第二个是HOLLYWOOD2,提供2517个电影片段及19名受试者的眼动注视点。在IRCYYN数据集上,获得的准确率为89.51%。在HOLLYWOOD2数据集上,相对于仅使用RGB,块显著性预测结果显示出最高2%的提升,最终准确率为76.6%。将预测的显著性图与视觉注视图比较的AUC指标在该数据集的部分视频片段上显示出最高16%的提升。

关键词

引用

@article{arxiv.1604.08010,
  title  = {Deep Learning for Saliency Prediction in Natural Video},
  author = {Souad Chaabouni and Jenny Benois-Pineau and Ofer Hadar and Chokri Ben Amar},
  journal= {arXiv preprint arXiv:1604.08010},
  year   = {2016}
}