重访视频显著性: 大规模基准与新模型
计算机视觉与模式识别
2018-05-29 v3
摘要
本文从两方面为视频显著性研究做出贡献。首先,我们引入了一个用于预测动态场景自由观看时人眼运动的新基准,这是该领域长期所需。我们的数据集名为 DHF1K(Dynamic Human Fixation),由 1K 段高质量、精心筛选的视频序列组成,涵盖大范围的场景、运动、物体类型与背景复杂度。现有视频显著性数据集缺乏常见动态场景的多样性和通用性,且不足以覆盖无约束环境中的挑战性情形。相比之下,DHF1K 在规模、多样性和难度上实现显著飞跃,有望推动视频显著性建模。其次,我们提出了一种新颖的视频显著性模型,将 CNN-LSTM 网络架构与注意力机制增强结合,以实现快速的端到端显著性学习。该注意力机制显式编码静态显著性信息,从而使 LSTM 能够专注于学习跨连续帧的更灵活的时间显著性表示。此类设计充分利用现有大规模静态注视数据集,避免过拟合,并显著提升训练效率与测试性能。我们在三个大规模数据集(即 DHF1K、Hollywood2、UCF sports)上针对最先进显著性模型彻底检验了本模型性能。在超过 1.2K 测试视频(含 400K 帧)上的实验结果表明,我们的模型优于其他竞争模型。
引用
@article{arxiv.1801.07424,
title = {Revisiting Video Saliency: A Large-scale Benchmark and a New Model},
author = {Wenguan Wang and Jianbing Shen and Fang Guo and Ming-Ming Cheng and Ali Borji},
journal= {arXiv preprint arXiv:1801.07424},
year = {2018}
}
备注
CVPR2018 paper. Website: https://github.com/wenguanwang/DHF1K We have corrected some statistics of our results (baseline training setting (iii)) on UCF sports dataset