Open-Fusion:基于 RGB-D 的实时开放词汇 3D 映射与可查询场景表示
计算机视觉与模式识别
2023-10-09 v1 机器人学
摘要
精确的 3D 环境建图在机器人学中至关重要。现有方法通常依赖训练时的预定义概念,或在生成语义图时耗时严重。本文提出 Open-Fusion,一种利用 RGB-D 数据进行实时开放词汇 3D 映射与可查询场景表示的突破性方法。Open-Fusion 借助预训练的视觉-语言基础模型(VLFM)实现开放集语义理解,并采用截断符号距离函数(TSDF)进行快速 3D 场景重建。通过利用 VLFM,我们提取基于区域的嵌入及其关联的置信度图。随后使用一种增强的基于匈牙利算法的特征匹配机制将其与来自 TSDF 的 3D 知识相融合。值得注意的是,Open-Fusion 无需额外 3D 训练即可为开放词汇提供出色的无标注 3D 分割。在 ScanNet 数据集上与领先零样本方法的基准测试凸显了 Open-Fusion 的优越性。此外,它无缝结合了基于区域的 VLFM 与 TSDF 的优势,促进包含物体概念与开放世界语义的实时 3D 场景理解。我们鼓励读者在我们的项目页面查看演示:https://uark-aicv.github.io/OpenFusion
引用
@article{arxiv.2310.03923,
title = {Open-Fusion: Real-time Open-Vocabulary 3D Mapping and Queryable Scene Representation},
author = {Kashu Yamazaki and Taisei Hanyu and Khoa Vo and Thang Pham and Minh Tran and Gianfranco Doretto and Anh Nguyen and Ngan Le},
journal= {arXiv preprint arXiv:2310.03923},
year = {2023}
}