中文

QueSTMaps:用于3D场景理解的可查询语义拓扑地图

计算机视觉与模式识别 2024-12-13 v2 机器人学

摘要

诸如规划和导航等机器人任务需要对场景进行层次化语义理解,其中可能包括多个楼层和房间。当前方法主要关注用于3D场景理解的目标分割。然而,此类方法难以分割出场景中的拓扑区域,例如“厨房”。在这项工作中,我们引入了一个两步流水线来解决这个问题。首先,我们使用一种新颖的多通道占据表示提取拓扑地图,即室内场景的平面图。然后,我们使用自注意力变换器基于每个房间实例包含的目标生成CLIP对齐的特征和语义标签。我们的语言-拓扑对齐支持自然语言查询,例如,“烹饪的地方”定位到“厨房”。我们在房间分割上比当前最先进方法提高了约20%,在房间分类上提高了约12%。我们详细的定性分析和消融研究为联合结构性和语义性3D场景理解问题提供了见解。项目页面:quest-maps.github.io

关键词

引用

@article{arxiv.2404.06442,
  title  = {QueSTMaps: Queryable Semantic Topological Maps for 3D Scene Understanding},
  author = {Yash Mehan and Kumaraditya Gupta and Rohit Jayanti and Anirudh Govil and Sourav Garg and Madhava Krishna},
  journal= {arXiv preprint arXiv:2404.06442},
  year   = {2024}
}

备注

Accepted at 2024 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) as Oral Presentation. Also presented at the 2nd Workshop on Open-Vocabulary 3D Scene Understanding (OpenSUN3D) at CVPR 2024