RoboOcc:增强机器人几何与语义场景理解
机器人学
2025-04-22 v1
摘要
3D 占用预测使机器人获得周围场景的空间细粒度几何与语义信息,已成为具身感知的关键任务。基于 3D 高斯值的现有方法未能有效利用高斯值的几何属性和不透明度特性,限制了网络对复杂环境的估计,也限制了 3D 高斯值对场景的描述。本文提出了一种增强机器人几何与语义场景理解的 3D 占用预测方法,称为 RoboOcc。它利用不透明度引导的自编码器(OSE)来缓解重叠高斯值的语义歧义,并利用几何感知的交叉编码器(GCE)实现周围场景的细粒度几何建模。我们在 Occ-ScanNet 和 EmbodiedOcc-ScanNet 数据集上进行了广泛实验,RoboOcc 在局部和全局相机设置下均实现了最先进的性能。进一步地,在高斯参数消融实验中,所提出的 RoboOcc 在 IoU 和 mIoU 指标上分别优于最先进方法大幅度地提升了 (8.47, 6.27)。代码将很快公开。
引用
@article{arxiv.2504.14604,
title = {RoboOcc: Enhancing the Geometric and Semantic Scene Understanding for Robots},
author = {Zhang Zhang and Qiang Zhang and Wei Cui and Shuai Shi and Yijie Guo and Gang Han and Wen Zhao and Hengle Ren and Renjing Xu and Jian Tang},
journal= {arXiv preprint arXiv:2504.14604},
year = {2025}
}