基于 Ambisonic 音频引导的全景视频显著目标检测
计算机视觉与模式识别
2022-11-29 v1
摘要
视频显著目标检测(VSOD)作为一个基础计算机视觉问题,在过去十年中被广泛讨论。然而,所有现有工作都聚焦于解决2D场景下的 VSOD 问题。随着 VR 设备的快速发展,全景视频已成为替代2D视频以提供真实世界沉浸感的有前景选择。本文中,我们旨在利用对应的 ambisonic 音频解决全景视频的视频显著目标检测问题。提出了一个配备两个伪孪生视听上下文融合(ACF)块的多模态融合模块,以有效进行视听交互。配备球面位置编码的 ACF 块使得在3D上下文中进行融合,以捕获等距柱状帧与 ambisonic 音频中像素与声源间的空间对应关系。实验结果验证了我们所提组件的有效性,并表明我们的方法在 ASOD60K 数据集上取得了最先进性能。
引用
@article{arxiv.2211.14419,
title = {Panoramic Video Salient Object Detection with Ambisonic Audio Guidance},
author = {Xiang Li and Haoyuan Cao and Shijie Zhao and Junlin Li and Li Zhang and Bhiksha Raj},
journal= {arXiv preprint arXiv:2211.14419},
year = {2022}
}