中文

ScanQA:面向空间场景理解的3D问答

计算机视觉与模式识别 2022-05-10 v3

摘要

我们提出了一种3D空间理解新任务——3D问答(3D-QA)。在3D-QA任务中,模型接收来自丰富RGB-D室内扫描的整个3D场景的视觉信息,并回答给定的关于该3D场景的文本问题。与VQA的2D问答不同,常规2D-QA模型受困于物体对齐与方向的空间理解问题,并在3D-QA中无法从文本问题中识别物体。我们提出了一种用于3D-QA的基线模型,称为ScanQA模型,该模型从3D物体提议和编码句子嵌入中学习融合描述子。该学习到的描述子将语言表达与3D扫描的底层几何特征相关联,并促进3D边界框的回归以确定文本问题中描述的对象并输出正确答案。我们收集了人工编辑的、具有基于3D场景中物体 grounding 的自由形式答案的问答对。我们的新ScanQA数据集包含从ScanNet数据集抽取的800个室内场景中的超过40K问答对。据我们所知,所提出的3D-QA任务是首个在3D环境中执行物体 grounding 问答的大规模尝试。

关键词

引用

@article{arxiv.2112.10482,
  title  = {ScanQA: 3D Question Answering for Spatial Scene Understanding},
  author = {Daichi Azuma and Taiki Miyanishi and Shuhei Kurita and Motoaki Kawanabe},
  journal= {arXiv preprint arXiv:2112.10482},
  year   = {2022}
}

备注

CVPR2022. The first three authors are equally contributed. Project page: https://github.com/ATR-DBI/ScanQA