中文

Pano-AVQA:基于 360$^\circ$ 视频的接地式音视频问答

计算机视觉与模式识别 2021-10-12 v1

摘要

360^\circ 视频传达了场景周围环境的全景视图。它提供了超出预定普通视场的音视频线索,并在球面上展现出独特的空间关系。然而,先前针对全景视频的基准任务仍局限于评估对周围环境中音视频关系或球面空间属性的语义理解。我们提出了一个名为 Pano-AVQA 的新基准,作为一个大规模基于全景视频的接地式音视频问答数据集。利用从网上收集的 5.4K 个 360^\circ 视频片段,我们收集了两类带有边界框接地的新型问答对:球面空间关系问答和音视频关系问答。我们在 Pano-AVQA 上训练了若干基于 transformer 的模型,结果表明我们提出的球面空间嵌入和多模态训练目标对该数据集上全景周围环境的更好语义理解有显著贡献。

关键词

引用

@article{arxiv.2110.05122,
  title  = {Pano-AVQA: Grounded Audio-Visual Question Answering on 360$^\circ$ Videos},
  author = {Heeseung Yun and Youngjae Yu and Wonsuk Yang and Kangil Lee and Gunhee Kim},
  journal= {arXiv preprint arXiv:2110.05122},
  year   = {2021}
}

备注

Published to ICCV2021