中文

基于组合场景操控的点云综合视觉问答

计算机视觉与模式识别 2023-05-23 v3

摘要

三维点云视觉问答(VQA-3D)是一个新兴且具有挑战性的领域,旨在给定整个点云场景的情况下回答各类文本问题。为解决该问题,我们提出了 CLEVR3D,一个由来自 8,771 个 3D 场景的 171K 个问题组成的大规模 VQA-3D 数据集。具体而言,我们开发了一个利用 3D 场景图结构生成多样化推理问题的提问引擎,涵盖物体属性(即尺寸、颜色和材质)及其空间关系的问题。通过此种方式,我们从 1,333 个真实场景初步生成了 44K 个问题。此外,我们提出了一个更具挑战性的设定,以消除混淆偏差并调整来自常识布局的上下文。该设定要求网络在 3D 场景不同于一般共现上下文(例如椅子总是与桌子一起出现)时实现综合视觉理解。为此,我们进一步引入组合场景操控策略,并从 7,438 个增强的 3D 场景生成了 127K 个问题,从而可提升 VQA-3D 模型对真实世界的理解能力。基于所提出的数据集,我们对若干 VQA-3D 模型进行了基线测试,实验结果验证了 CLEVR3D 能显著促进其他 3D 场景理解任务。我们的代码和数据集将公开于 https://github.com/yanx27/CLEVR3D。

关键词

引用

@article{arxiv.2112.11691,
  title  = {Comprehensive Visual Question Answering on Point Clouds through Compositional Scene Manipulation},
  author = {Xu Yan and Zhihao Yuan and Yuhao Du and Yinghong Liao and Yao Guo and Zhen Li and Shuguang Cui},
  journal= {arXiv preprint arXiv:2112.11691},
  year   = {2023}
}