中文

STAViS:时空视听显著性网络

计算机视觉与模式识别 2020-06-16 v2

摘要

我们提出 STAViS,一种时空视听显著性网络,它结合时空视觉与听觉信息,以高效解决视频中的显著性估计问题。我们的方法采用单一网络,将视觉显著性与听觉特征相结合,并学习适当地定位声源以及融合两种显著性,从而获得最终的显著性图。该网络经过端到端设计、训练,并在六个包含大量各类视频的视听眼动追踪数据的数据库上进行了评估。我们将我们的方法与 8 种不同的先进视觉显著性模型进行比较。跨数据库的评估结果表明,在多数情况下,我们的 STAViS 模型优于仅视觉变体以及其他先进模型。此外,它在所有数据库上一致的良好表现表明其适用于“自然场景”下的显著性估计。代码可在 https://github.com/atsiami/STAViS 获取。

关键词

引用

@article{arxiv.2001.03063,
  title  = {STAViS: Spatio-Temporal AudioVisual Saliency Network},
  author = {Antigoni Tsiami and Petros Koutras and Petros Maragos},
  journal= {arXiv preprint arXiv:2001.03063},
  year   = {2020}
}

备注

CVPR 2020. Project page: https://github.com/atsiami/STAViS