中文

PanoSLAM: 基于高斯SLAM的全景3D场景重建

计算机视觉与模式识别 2025-01-03 v1 机器人学

摘要

理解从连续视频数据中得到的3D场景的几何、语义和实例信息对于机器人和增强现实应用至关重要。然而,现有的同时定位与地图构建(SLAM)方法通常只关注几何或语义重建。在本文中,我们介绍了PanoSLAM,这是第一个将几何重建、3D语义分割和3D实例分割集成在统一框架中的SLAM系统。我们的方法基于3D高斯泼溅,并修改了几个关键组件,以实现从任意视角高效渲染深度、颜色、语义和实例信息。为了从连续的RGB-D视频实现全景3D场景重建,我们提出了一个在线时空提升(STL)模块,将视觉模型的2D全景预测转移到3D高斯表示中。该STL模块通过跨多视图输入细化伪标签,解决了2D预测中的标签噪声和不一致性问题,创建了连贯的3D表示,提高了分割精度。实验表明,PanoSLAM在映射和跟踪精度上均优于最近的语义SLAM方法。首次实现了直接从RGB-D视频对开放世界环境进行全景3D重建。(https://github.com/runnanchen/PanoSLAM)

关键词

引用

@article{arxiv.2501.00352,
  title  = {PanoSLAM: Panoptic 3D Scene Reconstruction via Gaussian SLAM},
  author = {Runnan Chen and Zhaoqing Wang and Jiepeng Wang and Yuexin Ma and Mingming Gong and Wenping Wang and Tongliang Liu},
  journal= {arXiv preprint arXiv:2501.00352},
  year   = {2025}
}