中文

Point2Graph: 基于点云的端到端 3D 开放词汇场景图用于机器人导航

机器人学 2024-09-17 v1 人工智能 计算机视觉与模式识别

摘要

当前的开放词汇场景图生成算法高度依赖 3D 场景点云数据和带位姿的 RGB-D 图像,因此在 RGB-D 图像或相机位姿不易获取的场景中应用受限。为了解决这个问题,我们提出了 Point2Graph,一种新颖的基于点云的端到端 3D 开放词汇场景图生成框架,在该框架中消除了对带位姿 RGB-D 图像序列的要求。这种分层框架包含房间和物体的检测/分割以及开放词汇分类。对于房间层,我们利用将基于几何的边界检测算法与基于学习的区域检测相融合的优势来分割房间,并创建了一个用于开放词汇房间分类的“Snap-Lookup”框架。此外,我们为物体层创建了一个端到端流水线,仅基于 3D 点云数据来检测和分类 3D 物体。我们的评估结果表明,我们的框架在广泛使用的真实场景数据集上,能够优于当前最先进的(SOTA)开放词汇物体和房间分割与分类算法。

关键词

引用

@article{arxiv.2409.10350,
  title  = {Point2Graph: An End-to-end Point Cloud-based 3D Open-Vocabulary Scene Graph for Robot Navigation},
  author = {Yifan Xu and Ziming Luo and Qianwei Wang and Vineet Kamat and Carol Menassa},
  journal= {arXiv preprint arXiv:2409.10350},
  year   = {2024}
}

备注

8 pages, 9 figures