3D 问答
计算机视觉与模式识别
2022-11-30 v2
摘要
视觉问答(VQA)近年来取得了巨大进展。然而,大多数工作仅关注 2D 图像问答任务。在本文中,我们首次尝试将 VQA 扩展到 3D 领域,这可以促进人工智能对 3D 真实世界场景的感知。与基于图像的 VQA 不同,3D 问答(3DQA)以彩色点云作为输入,并要求同时具备外观与 3D 几何理解能力来回答 3D 相关问题。为此,我们提出了一种新颖的基于 transformer 的 3DQA 框架“3DQA-TR”,其由两个分别用于提取外观与几何信息的编码器组成。外观、几何与语言问题的多模态信息最终可通过 3D-Linguistic Bert 相互关注以预测目标答案。为验证我们所提 3DQA 框架的有效性,我们进一步构建了首个 3DQA 数据集“ScanQA”,其基于 ScanNet 数据集,包含约 6K 问题、约 30K 答案,涵盖 个场景。在该数据集上的大量实验表明,我们所提 3DQA 框架相较现有 VQA 框架具有明显优越性,且我们的主要设计是有效的。我们的代码与数据集将公开以提供便利以推动该方向的研究。
引用
@article{arxiv.2112.08359,
title = {3D Question Answering},
author = {Shuquan Ye and Dongdong Chen and Songfang Han and Jing Liao},
journal= {arXiv preprint arXiv:2112.08359},
year = {2022}
}
备注
To Appear at IEEE Transactions on Visualization and Computer Graphics (TVCG) 2022