中文

基于 Ambisonic 音频引导的全景视频显著目标检测

计算机视觉与模式识别 2022-11-29 v1

摘要

视频显著目标检测(VSOD)作为一个基础计算机视觉问题,在过去十年中被广泛讨论。然而,所有现有工作都聚焦于解决2D场景下的 VSOD 问题。随着 VR 设备的快速发展,全景视频已成为替代2D视频以提供真实世界沉浸感的有前景选择。本文中,我们旨在利用对应的 ambisonic 音频解决全景视频的视频显著目标检测问题。提出了一个配备两个伪孪生视听上下文融合(ACF)块的多模态融合模块,以有效进行视听交互。配备球面位置编码的 ACF 块使得在3D上下文中进行融合,以捕获等距柱状帧与 ambisonic 音频中像素与声源间的空间对应关系。实验结果验证了我们所提组件的有效性,并表明我们的方法在 ASOD60K 数据集上取得了最先进性能。

关键词

引用

@article{arxiv.2211.14419,
  title  = {Panoramic Video Salient Object Detection with Ambisonic Audio Guidance},
  author = {Xiang Li and Haoyuan Cao and Shijie Zhao and Junlin Li and Li Zhang and Bhiksha Raj},
  journal= {arXiv preprint arXiv:2211.14419},
  year   = {2022}
}