开放词汇的 SLAM 在线三维语义建图
计算机视觉与模式识别
2025-10-09 v3 机器人学
摘要
本文提出了一种开放词汇的在线三维语义建图流程,我们以缩写 OVO 表示。给定一系列带位姿的 RGB-D 帧,我们检测并跟踪三维分割,并使用 CLIP 向量进行描述,这些向量通过一种新颖的 CLIP 合并方法从不同视角计算得出。值得注意的是,我们的 OVO 比离线基线具有更低的内存和计算开销,同时展现出优于离线和在线基线的分割性能。除了优越的分割性能外,我们还展示了我们的建图贡献与两个完整的 SLAM 后端(Gaussian-SLAM 和 ORB-SLAM2)集成的实验结果,这是首次使用神经网络合并 CLIP 描述符,并实现了端到端的开放词汇在线三维建图与闭环。
引用
@article{arxiv.2411.15043,
title = {Open-Vocabulary Online Semantic Mapping for SLAM},
author = {Tomas Berriel Martins and Martin R. Oswald and Javier Civera},
journal= {arXiv preprint arXiv:2411.15043},
year = {2025}
}
备注
Accepted for IEEE Robotics and Automation Letters