中文

重新思考视频显著物体排序

计算机视觉与模式识别 2022-04-01 v1

摘要

显著物体排序(SOR)涉及对输入图像中多个显著物体的显著程度进行排序。最近,一种基于预测注视图对输入视频中显著物体排序的方法被提出。它仅依赖显著物体内注视点的密度来推断其显著等级,这与人类对于显著排序的感知不相容。在本工作中,我们提出显式学习不同显著物体之间的空间与时间关系以产生显著等级。为此,我们提出一种端到端的视频显著物体排序(VSOR)方法,带有两个新颖模块:帧内自适应关系(IAR)模块,用于局部与全局地学习同帧中显著物体间的空间关系;以及帧间动态关系(IDR)模块,用于建模跨不同帧的显著时间关系。此外,为解决现有 VSOR 数据集中视频类型(仅体育与电影)与场景多样性有限的问题,我们提出一个覆盖不同视频类型与多样场景的大规模新数据集。实验结果表明我们的方法优于相关领域中的最先进方法。我们将公开源代码与我们提出的数据集。

关键词

引用

@article{arxiv.2203.17257,
  title  = {Rethinking Video Salient Object Ranking},
  author = {Jiaying Lin and Huankang Guan and Rynson W. H. Lau},
  journal= {arXiv preprint arXiv:2203.17257},
  year   = {2022}
}