中文

ConceptFusion:开放集多模态三维建图

计算机视觉与模式识别 2023-10-24 v3 人工智能 机器人学

摘要

构建环境的三维地图对机器人导航、规划及与场景中物体交互至关重要。现有大多数将语义概念与三维地图整合的方法仍局限于封闭集设定:它们只能推理训练时预定义的有限概念集合。此外,这些地图仅能用类别标签查询,或如近期工作那样用文本提示查询。我们通过 ConceptFusion 解决这两个问题,这是一种(1)根本上开放集的、支持超越封闭概念集推理,且(ii)天然多模态的场景表示,支持从语言、图像、音频到三维几何的多样化查询,且协同工作。ConceptFusion 利用当今在海量互联网数据上预训练的基础模型的开放集能力,跨自然语言、图像与音频等模态推理概念。我们证明了像素对齐的开放集特征可通过传统 SLAM 与多视图融合方法融入三维地图。这实现了有效的零样本空间推理,无需额外训练或微调,并比监督方法更好地保留长尾概念,在三维 IoU 上以超 40% 的优势超越它们。我们在多个真实世界数据集、模拟家居环境、真实世界桌面操作任务及自动驾驶平台上广泛评估了 ConceptFusion。我们展示了将基础模型与三维开放集多模态建图融合的新途径。更多信息请访问项目页 https://concept-fusion.github.io 或观看 5 分钟讲解视频 https://www.youtube.com/watch?v=rkXgws8fiDs

关键词

引用

@article{arxiv.2302.07241,
  title  = {ConceptFusion: Open-set Multimodal 3D Mapping},
  author = {Krishna Murthy Jatavallabhula and Alihusein Kuwajerwala and Qiao Gu and Mohd Omama and Tao Chen and Alaa Maalouf and Shuang Li and Ganesh Iyer and Soroush Saryazdi and Nikhil Keetha and Ayush Tewari and Joshua B. Tenenbaum and Celso Miguel de Melo and Madhava Krishna and Liam Paull and Florian Shkurti and Antonio Torralba},
  journal= {arXiv preprint arXiv:2302.07241},
  year   = {2023}
}

备注

RSS 2023. Project page: https://concept-fusion.github.io Explainer video: https://www.youtube.com/watch?v=rkXgws8fiDs Code: https://github.com/concept-fusion/concept-fusion