中文

城市场景的 3D 问答

计算机视觉与模式识别 2024-07-25 v1

摘要

3D 多模态问答 (MQA) 在场景理解中发挥着关键作用,使能够理解其周围环境的智能代理能够在 3D 环境中进行 comprehension。虽然现有研究主要聚焦于室内家庭任务和户外道路side 自动驾驶任务,但对城市级别场景理解任务的探索仍有限。此外,现有研究在理解城市场景时面临挑战,主要由于缺乏城市层面的空间语义信息和人与环境交互信息。为此,我们从数据集和方法两个角度来探索 3D MQA。从数据集角度,我们引入了一个名为 City-3DQA 的新型 3D MQA 数据集,用于城市级别的场景理解,这是第一个集成场景语义和人与环境交互任务于城市中的数据集。从方法角度,我们提出了一种名为 Sg-CityU 的场景图增强的城市级理解方法 (Scene graph enhanced City-level Understanding method),该方法利用场景图引入空间语义。我们报告了一个新的基准测试,我们的 Sg-CityU 在 City-3DQA 的不同设置下分别 achieves 63.94% 和 63.76% 的准确率。与室内 3D MQA 方法以及使用先进大语言模型 (LLM) 的零样本方法相比,Sg-CityU 在鲁棒性和泛化能力方面表现出 SOTA 水平。

关键词

引用

@article{arxiv.2407.17398,
  title  = {3D Question Answering for City Scene Understanding},
  author = {Penglei Sun and Yaoxian Song and Xiang Liu and Xiaofei Yang and Qiang Wang and Tiefeng Li and Yang Yang and Xiaowen Chu},
  journal= {arXiv preprint arXiv:2407.17398},
  year   = {2024}
}