中文

Cam4DOcc:自动驾驶应用中仅相机4D占据预测的基准

计算机视觉与模式识别 2025-11-17 v3

摘要

理解周围环境如何变化对于自动驾驶应用中安全可靠地执行下游任务至关重要。近期仅使用相机图像作为输入的占据估计技术,可基于当前观测提供大规模场景的稠密占据表示。然而,它们大多局限于表示当前3D空间,未考虑沿时间轴周围物体的未来状态。为将仅相机的占据估计扩展至时空预测,我们提出Cam4DOcc,一个用于仅相机4D占据预测的新基准,用于评估近未来周围场景的变化。我们基于多个公开可用数据集构建基准,包括nuScenes、nuScenes-Occupancy和Lyft-Level5,其提供通用可移动与静态物体的序列占据状态,以及它们的3D向后向心流。为建立该基准以供未来研究进行全面比较,我们引入了来自多种基于相机的感知与预测实现的四类基线,包括静态世界占据模型、点云预测体素化、基于2D-3D实例的预测,以及我们提出的新颖端到端4D占据预测网络。此外,还提供了针对预设多任务的标准化评估协议,以比较所有提出基线在自动驾驶场景感兴趣物体上当前与未来占据估计的性能。该数据集及我们在所提Cam4DOcc基准中所有四类基线的实现将发布于此:https://github.com/haomo-ai/Cam4DOcc。

关键词

引用

@article{arxiv.2311.17663,
  title  = {Cam4DOcc: Benchmark for Camera-Only 4D Occupancy Forecasting in Autonomous Driving Applications},
  author = {Junyi Ma and Xieyuanli Chen and Jiawei Huang and Jingyi Xu and Zhen Luo and Jintao Xu and Weihao Gu and Rui Ai and Hesheng Wang},
  journal= {arXiv preprint arXiv:2311.17663},
  year   = {2025}
}

备注

Accepted to CVPR 2024