中文

面向部件、位姿与遮挡的3D感知视觉问答

计算机视觉与模式识别 2023-10-30 v1 计算与语言

摘要

尽管视觉问答(VQA)取得了快速进展,现有数据集与模型主要聚焦于测试2D推理。然而,VQA模型理解视觉场景的3D结构同样重要,例如以支持导航或操控等任务。这包括对3D物体位姿、其部件及遮挡的理解。本工作中,我们引入3D感知VQA任务,其关注需要针对视觉场景3D结构进行组合推理的具有挑战性的问题。我们从数据集与模型两个角度解决3D感知VQA。首先,我们提出Super-CLEVR-3D,一个包含关于物体部件、其3D位姿及遮挡问题的组合推理数据集。其次,我们提出PO3D-VQA,一个3D感知VQA模型,其融合了两种强大思路:用于推理的概率神经符号程序执行,以及带有物体3D生成表示的深度神经网络以实现鲁棒视觉识别。我们的实验结果表明,我们的模型PO3D-VQA显著优于现有方法,但我们仍观察到相比2D VQA基准的显著性能差距,表明3D感知VQA仍是一个重要的开放研究领域。

关键词

引用

@article{arxiv.2310.17914,
  title  = {3D-Aware Visual Question Answering about Parts, Poses and Occlusions},
  author = {Xingrui Wang and Wufei Ma and Zhuowan Li and Adam Kortylewski and Alan Yuille},
  journal= {arXiv preprint arXiv:2310.17914},
  year   = {2023}
}

备注

Accepted by NeurIPS2023