基于 Object-to-Motion CNN 与两层卷积 LSTM 的视频显著性预测
计算机视觉与模式识别
2019-01-16 v3
摘要
在过去几年中,深度神经网络(DNN)在预测图像显著性方面取得了巨大成功。然而,将 DNN 应用于预测通用视频显著性的工作很少。在本文中,我们提出了一种基于 DNN 的视频显著性预测新方法。具体而言,我们建立了一个大规模视频眼动数据库(LEDOV),为训练用于预测视频显著性的 DNN 模型提供了充足的数据。通过对我们的 LEDOV 数据库进行统计分析,我们发现人类注意力通常被物体吸引,特别是运动物体或物体的运动部分。因此,我们提出了一种 object-to-motion 卷积神经网络(OM-CNN),通过探索目标性和目标运动的信息来学习时空特征,以预测帧内显著性。我们进一步从数据库中发现,人类注意力存在时间相关性,且在视频帧之间具有平滑的显著性过渡。因此,我们在基于 DNN 的方法中开发了一个两层卷积长短期记忆(2C-LSTM)网络,使用 OM-CNN 提取的特征作为输入。由此,可以生成考虑跨视频帧注意力过渡的视频帧间显著性图。最后,实验结果表明,我们的方法在视频显著性预测方面推进了 state-of-the-art。
引用
@article{arxiv.1709.06316,
title = {Predicting Video Saliency with Object-to-Motion CNN and Two-layer Convolutional LSTM},
author = {Lai Jiang and Mai Xu and Zulin Wang},
journal= {arXiv preprint arXiv:1709.06316},
year = {2019}
}
备注
Jiang, Lai and Xu, Mai and Liu, Tie and Qiao, Minglang and Wang, Zulin; DeepVS: A Deep Learning Based Video Saliency Prediction Approach;The European Conference on Computer Vision (ECCV); September 2018