中文

用于 360{\deg} 视频显著性检测的全景视觉Transformer

计算机视觉与模式识别 2022-09-20 v1

摘要

360^\circ 视频显著性检测是 360^\circ 视频理解中具有挑战性的基准之一,因为任意格式的 360^\circ 视频在投影中会出现不可忽略的畸变与不连续性,且全向球体中值得捕获的视点本质上模糊。我们提出一个名为全景视觉Transformer(PAVER)的新框架。我们使用带可变形卷积的 Vision Transformer 设计编码器,这不仅使我们无需额外模块或微调即可将正常视频的预训练模型接入架构,而且与先前基于深度 CNN 的方法不同,只需进行一次几何近似。凭借其强大的编码器,PAVER 可从局部块特征间三种简单的相对关系中学习显著性,在无监督或类激活等辅助信息的情况下大幅超越 Wild360 基准上的最优(state-of-the-art)模型。我们通过在 VQA-ODV 的全向视频质量评估任务中展示显著性预测模型的效用,其中我们持续提高性能而无需包括头部运动在内的任何形式监督。

关键词

引用

@article{arxiv.2209.08956,
  title  = {Panoramic Vision Transformer for Saliency Detection in 360{\deg} Videos},
  author = {Heeseung Yun and Sehun Lee and Gunhee Kim},
  journal= {arXiv preprint arXiv:2209.08956},
  year   = {2022}
}

备注

Published to ECCV2022