中文

SalFoM:基于视频基础模型的动态显著性预测

计算机视觉与模式识别 2024-04-05 v1

摘要

视频显著性预测(VSP)的最新进展展现出了堪比人类视觉系统的良好性能,而人类视觉系统的模拟正是 VSP 的主要目标。然而,当前的最先进模型采用在有限数据量上训练的时空 Transformer,阻碍了其对下游任务的泛化适应。视觉基础模型的优势为改进 VSP 过程提供了一种潜在的解决方案。然而,将图像基础模型适配到视频领域在建模场景动态和捕获时序信息方面带来了重大挑战。为了应对这些挑战,并作为基于视频基础模型设计 VSP 模型的首次尝试,我们引入了 SalFoM,一种新颖的编码器-解码器视频 Transformer 架构。我们的模型采用 UnMasked Teacher (UMT) 作为特征提取器,并提出了一种异构解码器,该解码器以具有局部感知的时空 Transformer 为特色,并从多个视角整合局部和全局时空信息以生成最终的显著性图。我们在具有挑战性的 VSP 基准数据集 DHF1K、Hollywood-2 和 UCF-Sports 上进行的定性和定量实验证明了我们提出的模型相较于最先进方法的优越性。

关键词

引用

@article{arxiv.2404.03097,
  title  = {SalFoM: Dynamic Saliency Prediction with Video Foundation Models},
  author = {Morteza Moradi and Mohammad Moradi and Francesco Rundo and Concetto Spampinato and Ali Borji and Simone Palazzo},
  journal= {arXiv preprint arXiv:2404.03097},
  year   = {2024}
}

备注

15 pages, 4 figures