QueSTMaps:用于3D场景理解的可查询语义拓扑地图
计算机视觉与模式识别
2024-12-13 v2 机器人学
摘要
诸如规划和导航等机器人任务需要对场景进行层次化语义理解,其中可能包括多个楼层和房间。当前方法主要关注用于3D场景理解的目标分割。然而,此类方法难以分割出场景中的拓扑区域,例如“厨房”。在这项工作中,我们引入了一个两步流水线来解决这个问题。首先,我们使用一种新颖的多通道占据表示提取拓扑地图,即室内场景的平面图。然后,我们使用自注意力变换器基于每个房间实例包含的目标生成CLIP对齐的特征和语义标签。我们的语言-拓扑对齐支持自然语言查询,例如,“烹饪的地方”定位到“厨房”。我们在房间分割上比当前最先进方法提高了约20%,在房间分类上提高了约12%。我们详细的定性分析和消融研究为联合结构性和语义性3D场景理解问题提供了见解。项目页面:quest-maps.github.io
引用
@article{arxiv.2404.06442,
title = {QueSTMaps: Queryable Semantic Topological Maps for 3D Scene Understanding},
author = {Yash Mehan and Kumaraditya Gupta and Rohit Jayanti and Anirudh Govil and Sourav Garg and Madhava Krishna},
journal= {arXiv preprint arXiv:2404.06442},
year = {2024}
}
备注
Accepted at 2024 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) as Oral Presentation. Also presented at the 2nd Workshop on Open-Vocabulary 3D Scene Understanding (OpenSUN3D) at CVPR 2024