中文

统一的图像与视频显著性建模

计算机视觉与模式识别 2020-11-10 v3 机器学习

摘要

在近期计算机视觉文献中,图像与视频的视觉显著性建模被视为两个独立任务。虽然图像显著性建模是已被充分研究的问题,且在SALICON和MIT300等基准上的进展正在放缓,但视频显著性模型在近期DHF1K基准上取得了快速增益。在此,我们退一步追问:图像与视频显著性建模能否通过统一模型以互惠方式处理?我们将图像与视频显著性数据之间以及不同视频显著性数据集之间的多种域偏移来源确定为有效联合建模的关键挑战。为此,我们提出了四种新颖的域适应技术——域自适应先验、域自适应融合、域自适应平滑与旁路RNN——以及对学习高斯先验的改进公式。我们将这些技术集成到一个简单轻量的编码器-RNN-解码器风格网络UNISAL中,并使用图像与视频显著性数据联合训练它。我们在视频显著性数据集DHF1K、Hollywood-2和UCF-Sports,以及图像显著性数据集SALICON和MIT300上评估了我们的方法。凭借一组参数,UNISAL在所有视频显著性数据集上取得了最先进(state-of-the-art)性能,并与图像显著性数据集上的最先进方法相当,尽管相比所有竞争的深度方法具有更快的推理速度和5至20倍的更小模型规模。我们提供了回溯性分析与消融研究,证实了域偏移建模的重要性。代码见 https://github.com/rdroste/unisal

关键词

引用

@article{arxiv.2003.05477,
  title  = {Unified Image and Video Saliency Modeling},
  author = {Richard Droste and Jianbo Jiao and J. Alison Noble},
  journal= {arXiv preprint arXiv:2003.05477},
  year   = {2020}
}

备注

Presented at the European Conference on Computer Vision (ECCV) 2020. R. Droste and J. Jiao contributed equally to this work. v3: Updated Fig. 5a) and added new MTI300 benchmark results to supp. material