EmbodiedOcc:基于机器人的 3D 占用预测用于在线场景理解
计算机视觉与模式识别
2025-08-26 v3 人工智能
机器学习
摘要
3D 占用预测提供了对周围场景的全面描述,已成为 3D 感知的关键任务。现有方法大多聚焦于离线单视图或少数几视图的感知,无法适用于需要通过逐步机体探索来逐渐感知场景的机体智能体。在本文中,我们构建了面向该实际场景的机体 3D 占用预测任务,提出了基于高斯分布的 EmbodiedOcc 框架实现其目标。我们以均匀分布的 3D 语义高斯初始化全局场景,并逐步更新由机体智能体观察到的局部区域。每次更新时,从观察图像中提取语义与结构特征,通过可调跨注意力高效融合以细化局部高斯。最后采用高斯到体素的投射方法获得更新后的全局 3D 占用。EmbodiedOcc 假设环境为未知(即均匀分布),并以 3D 高斯维护显式的全局记忆,随着局部高斯的逐步细化获得新知识,这符合人类通过机体探索理解新场景的方式。我们基于局部标注重新组织了 EmbodiedOcc-ScanNet 数据集,以便评估机体 3D 占用预测任务。实验表明,EmbodiedOcc 以显著优势超越现有方法,实现了高精度与高效能的机体占用预测。代码:https://github.com/YkiWu/EmbodiedOcc。
引用
@article{arxiv.2412.04380,
title = {EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding},
author = {Yuqi Wu and Wenzhao Zheng and Sicheng Zuo and Yuanhui Huang and Jie Zhou and Jiwen Lu},
journal= {arXiv preprint arXiv:2412.04380},
year = {2025}
}
备注
Accepted by ICCV2025. Code: https://github.com/YkiWu/EmbodiedOcc