从深度中学习注视转移以改进视频显著性估计
计算机视觉与模式识别
2016-03-14 v1
摘要
本文提出一种新颖的深度感知视频显著性(Depth-Aware Video Saliency)方法,用于预测在普通 2D 屏幕上观看 RGBD 视频时人的注意力焦点。我们训练了一个生成式卷积神经网络,在给定前一帧注视图的情况下预测当前帧的显著性图。该场景下的显著性估计极为重要,因为近未来 3D 视频内容将易于获取却难以显示。这一方面可由 3D 采集设备的显著改进解释;另一方面,尽管 3D 显示技术取得可观进展,多数 3D 显示仍昂贵且需佩戴特殊眼镜。为评估方法性能,我们提出了一个全新的 RGBD 视频眼动注视真值综合数据库。实验表明,将深度集成到视频显著性计算中有益。我们证明该方法超越了视频显著性的最优(state-of-the-art)方法,取得 15% 的相对提升。
引用
@article{arxiv.1603.03669,
title = {Learning Gaze Transitions from Depth to Improve Video Saliency Estimation},
author = {G. Leifman and D. Rudoy and T. Swedish and E. Bayro-Corrochano and R. Raskar},
journal= {arXiv preprint arXiv:1603.03669},
year = {2016}
}