中文

360°图像上的视觉问答

计算机视觉与模式识别 2020-01-13 v1

摘要

本文中,我们引入VQA 360,一种在360图像上进行视觉问答的新任务。与常规视场图像不同,360图像捕获相机光学中心周围的完整视觉内容,需要更复杂的空间理解与推理。为解决该问题,我们收集了首个VQA 360数据集,包含约17,000个真实世界的图像-问题-答案三元组,涵盖多种问题类型。随后我们在VQA 360上研究了两种不同VQA模型,包括一种以等距柱状图像(具固有畸变)为输入的传统模型,以及一种先将360图像投影到立方体贴图再聚合多空间分辨率信息的专用模型。我们证明基于立方体贴图并具有多级融合与注意力扩散的模型优于其他变体和基于等距柱状图的模型。尽管如此,人类与机器性能之间的差距表明需要更先进的VQA 360算法。因此,我们期望我们的数据集和研究可作为该挑战性任务未来发展的基准。数据集、代码和预训练模型均在线可用。

关键词

引用

@article{arxiv.2001.03339,
  title  = {Visual Question Answering on 360{\deg} Images},
  author = {Shih-Han Chou and Wei-Lun Chao and Wei-Sheng Lai and Min Sun and Ming-Hsuan Yang},
  journal= {arXiv preprint arXiv:2001.03339},
  year   = {2020}
}

备注

Accepted to WACV 2020