中文

RoboOcc:增强机器人几何与语义场景理解

机器人学 2025-04-22 v1

摘要

3D 占用预测使机器人获得周围场景的空间细粒度几何与语义信息,已成为具身感知的关键任务。基于 3D 高斯值的现有方法未能有效利用高斯值的几何属性和不透明度特性,限制了网络对复杂环境的估计,也限制了 3D 高斯值对场景的描述。本文提出了一种增强机器人几何与语义场景理解的 3D 占用预测方法,称为 RoboOcc。它利用不透明度引导的自编码器(OSE)来缓解重叠高斯值的语义歧义,并利用几何感知的交叉编码器(GCE)实现周围场景的细粒度几何建模。我们在 Occ-ScanNet 和 EmbodiedOcc-ScanNet 数据集上进行了广泛实验,RoboOcc 在局部和全局相机设置下均实现了最先进的性能。进一步地,在高斯参数消融实验中,所提出的 RoboOcc 在 IoU 和 mIoU 指标上分别优于最先进方法大幅度地提升了 (8.47, 6.27)。代码将很快公开。

关键词

引用

@article{arxiv.2504.14604,
  title  = {RoboOcc: Enhancing the Geometric and Semantic Scene Understanding for Robots},
  author = {Zhang Zhang and Qiang Zhang and Wei Cui and Shuai Shi and Yijie Guo and Gang Han and Wen Zhao and Hengle Ren and Renjing Xu and Jian Tang},
  journal= {arXiv preprint arXiv:2504.14604},
  year   = {2025}
}