机器人学中最佳的 3D 场景表示是什么?从几何表示到基础模型
机器人学
2026-01-13 v2 计算机视觉与模式识别
摘要
在本文中,我们对机器人学中现有的场景表示方法进行了全面综述,涵盖了传统表示方法,如点云、体素、有符号距离函数(SDF)和场景图,以及最近的神经表示方法,如神经辐射场(NeRF)、3D 高斯溅射(3DGS)和新兴的基础模型。虽然当前的 SLAM 和定位系统主要依赖点云和体素等稀疏表示,但密集场景表示预计将在导航和避障等下游任务中发挥关键作用。此外,NeRF、3DGS 和基础模型等神经表示方法非常适合集成高层语义特征和基于语言的先验知识,从而实现更全面的 3D 场景理解和具身智能。在本文中,我们将机器人学的核心模块分为五个部分(感知、映射、定位、导航、操作)。我们首先介绍不同场景表示方法的标准公式,并比较不同模块中场景表示的优缺点。本调查围绕以下问题展开:机器人学中最佳的 3D 场景表示是什么?随后我们讨论了 3D 场景表示的未来发展趋势,特别关注 3D 基础模型如何取代当前方法成为未来机器人应用的统一解决方案。我们还探讨了完全实现该模型面临的剩余挑战。我们旨在为新手和经验丰富的研究人员提供有价值的资源,以探索 3D 场景表示的未来及其在机器人学中的应用。我们已在 GitHub 上发布了一个开源项目,并将持续向该项目添加新的作品和技术。
引用
@article{arxiv.2512.03422,
title = {What Is The Best 3D Scene Representation for Robotics? From Geometric to Foundation Models},
author = {Tianchen Deng and Yue Pan and Shenghai Yuan and Dong Li and Chen Wang and Mingrui Li and Long Chen and Lihua Xie and Danwei Wang and Jingchuan Wang and Javier Civera and Hesheng Wang and Weidong Chen},
journal= {arXiv preprint arXiv:2512.03422},
year = {2026}
}