IRS:基于房间先验引导的 LiDAR-相机融合实例级 3D 场景图
机器人学
2025-06-10 v1
摘要
室内场景理解是机器人中的基础性挑战,直接影响导航和操控等下游任务。传统方法常依赖封闭词表识别或闭环检测,限制了其在开放世界环境中的适应性。随着视觉基础模型(VFM)的出现,开放词表识别和自然语言查询变得可行,为 3D 场景图构建开辟了新可能。本文提出一种基于 LiDAR-相机融合的实例级 3D 场景图构建的稳健高效框架。利用 LiDAR 广阔视野(FOV)和长距离感知能力,我们快速获取房间级几何先验。采用多层 VFM 提升语义提取的准确性和一致性。在实例融合过程中,基于房间的分割实现并行处理,几何线索与语义线索的融合显著提升了融合准确性和鲁棒性。与最新方法相比,我们的方法在构建速度上提升了约一个数量级,同时保持高语义精度。 extensive 实验在仿真和真实环境中验证了该方法的有效性。我们进一步通过语言引导的语义导航任务展示了其在实际机器人应用中的实用价值。
关键词
引用
@article{arxiv.2506.06804,
title = {IRS: Instance-Level 3D Scene Graphs via Room Prior Guided LiDAR-Camera Fusion},
author = {Hongming Chen and Yiyang Lin and Ziliang Li and Biyu Ye and Yuying Zhang and Ximin Lyu},
journal= {arXiv preprint arXiv:2506.06804},
year = {2025}
}