中文

用于360度视频显著性预测的球形视觉Transformer

计算机视觉与模式识别 2023-08-28 v1 人工智能 多媒体

摘要

捕获全视场(FOV)的全向视频(ODV)日益受到关注,使得360度显著性预测在计算机视觉中变得重要。然而,预测人类在360度场景中的注视点面临独特挑战,包括球形畸变、高分辨率和有限的标注数据。我们提出了一种基于视觉Transformer的名为SalViT360的全向视频模型,其利用切向图像表示。我们引入了一种球形几何感知的时空自注意力机制,能够有效理解全向视频。此外,我们提出了一种基于一致性的无监督正则化项,用于基于投影的360度密集预测模型,以减少逆投影后预测中出现的伪影。我们的方法是首个将切向图像用于全向显著性预测的方法,并且在三个ODV显著性数据集上的实验结果证明了其相对于当前最优方法的优越性。

关键词

引用

@article{arxiv.2308.13004,
  title  = {Spherical Vision Transformer for 360-degree Video Saliency Prediction},
  author = {Mert Cokelek and Nevrez Imamoglu and Cagri Ozcinar and Erkut Erdem and Aykut Erdem},
  journal= {arXiv preprint arXiv:2308.13004},
  year   = {2023}
}

备注

12 pages, 4 figures, accepted to BMVC 2023