中文

用于动态显著性预测的门控融合网络

计算机视觉与模式识别 2021-02-16 v1

摘要

预测视频中的显著性是极具挑战的问题,原因在于空间与时间信息间交互的复杂建模,尤其当考虑视频不断变化之动态本质时。近期研究者提出大规模数据集与利用深度学习的模型,以理解视频显著性的关键所在。然而,这些方法以静态方式学习结合空间与时域特征,并未随视频内容变化而充分自适应。本文引入用于动态显著性的门控融合网络(GFSalNet),这是首个能够通过门控融合机制以动态方式作出预测的深层显著性模型。此外,我们的模型还在多尺度架构中利用空间与通道注意力,进一步实现高度准确的预测。我们在多个数据集上评估所提方法,实验分析表明其优于或与当前最优方法极具竞争力。重要的是,我们展示其具备良好泛化能力,且通过其自适应融合方案更有效地利用了时间信息。

关键词

引用

@article{arxiv.2102.07682,
  title  = {A Gated Fusion Network for Dynamic Saliency Prediction},
  author = {Aysun Kocak and Erkut Erdem and Aykut Erdem},
  journal= {arXiv preprint arXiv:2102.07682},
  year   = {2021}
}

备注

Project page: https://hucvl.github.io/GFSalNet/