OpenOcc:基于占用表示的开放词汇 3D 场景重建
计算机视觉与模式识别
2024-08-12 v2 机器人学
摘要
3D 重建已广泛应用于移动机器人的自主导航领域。然而,以往的研究只能提供基本的几何结构,缺乏开放世界场景理解能力,限制了人机交互和视觉导航等高级任务。此外,传统的 3D 场景理解方法依赖昂贵的标注 3D 数据集,以监督方式训练单一任务的模型。因此,具备零样本场景理解能力的几何重建,即开放词汇 3D 理解与重建,对移动机器人的未来发展至关重要。本文中,我们提出 OpenOcc,一个利用神经辐射场统一 3D 场景重建与开放词汇理解的新框架。我们用占用表示对场景的几何结构进行建模,并通过体渲染将预训练的开放词汇模型蒸馏到 3D 语言场中,以实现零样本推理。此外,我们提出了一种新颖的语义感知置信度传播(SCP)方法,以缓解蒸馏特征中因测量不一致导致的语言场表示退化问题。实验结果表明,我们的方法在 3D 场景理解任务中取得了具有竞争力的性能,尤其是对于小目标和长尾目标。
引用
@article{arxiv.2403.11796,
title = {OpenOcc: Open Vocabulary 3D Scene Reconstruction via Occupancy Representation},
author = {Haochen Jiang and Yueming Xu and Yihan Zeng and Hang Xu and Wei Zhang and Jianfeng Feng and Li Zhang},
journal= {arXiv preprint arXiv:2403.11796},
year = {2024}
}
备注
This work is accepted by IROS 2024