基于全卷积网络的视频显著性目标检测
计算机视觉与模式识别
2017-12-12 v3
摘要
本文提出一种深度学习模型以高效检测视频中的显著区域。它解决了两个重要问题:(1) 在缺乏足够大且像素级标注的视频数据情况下的深度视频显著性模型训练,以及 (2) 快速的视频显著性训练与检测。所提出的深度视频显著性网络由两个模块组成,分别用于捕获空间和时间显著性信息。动态显著性模型显式地结合了来自静态显著性模型的显著性估计,直接产生时空显著性推断,而无需耗时的光流计算。我们进一步提出一种新颖的数据增强技术,从现有标注图像数据集中模拟视频训练数据,这使得我们的网络能够学习多样的显著性信息,并防止在有限训练视频数量下的过拟合。利用我们的合成视频数据(150K 视频序列)和真实视频,我们的深度视频显著性模型成功学习了空间与时间显著性线索,从而产生准确的时空显著性估计。我们在 DAVIS 数据集(MAE 为 .06)和 FBMS 数据集(MAE 为 .07)上推进了当前最佳水平,并且以大幅提升的速度(所有步骤 2fps)实现。
引用
@article{arxiv.1702.00871,
title = {Video Salient Object Detection via Fully Convolutional Networks},
author = {Wenguan Wang and Jianbing Shen and Ling Shao},
journal= {arXiv preprint arXiv:1702.00871},
year = {2017}
}
备注
W. Wang, J. Shen, and L. Shao, Video salient object detection via fully convolutional networks, IEEE Trans. on Image Processing, 27(1):38-49, 2018 Code and results: https://github.com/wenguanwang/deepvideosaliency