中文

ForecastOcc:基于视觉的语义占用预测

计算机视觉与模式识别 2026-02-10 v1 人工智能 机器学习 机器人学

摘要

自动驾驶需要对未来时间段的几何和语义信息进行预测,以有效地推理未来环境状态。现有的基于视觉的占用预测方法关注运动相关的类别,如静态和动态对象,而语义信息则基本缺失。最近的语义占用预测方法试图填补这一空白,但依赖于来自独立网络的过去占用预测,这使得当前方法对误差累积敏感,无法直接从图像中学习时空特征。在本工作中,我们提出 ForecastOcc,这是第一个进行视觉基语义占用预测的框架,能够同时预测未来占用状态和语义类别。我们的框架可直接从过去的摄像头图像预测多个时间段的语义占用预测,而无需依赖外部估计的地图。在两个互补的设置中进行评估:Occ3D-nuScenes 数据集上的多视角预测和 SemanticKITTI 上的单目预测,其中我们在该任务上建立了第一个基准。我们引入了通过适应两个 2D 预测模块形成的第一个基线。重要的是,我们提出了一种新型架构,集成了时序跨注意力预测模块、2D 到 3D 视图转换器、用于占用预测的 3D 编码器,以及用于跨多个时间段的体素级预测的语义占用头。在两个数据集上的大量实验表明,ForecastOcc 持续优于基线,生成富有语义信息的、具前瞻性的预测,捕捉到对自动驾驶至关重要的场景动态和语义。

关键词

引用

@article{arxiv.2602.08006,
  title  = {ForecastOcc: Vision-based Semantic Occupancy Forecasting},
  author = {Riya Mohan and Juana Valeria Hurtado and Rohit Mohan and Abhinav Valada},
  journal= {arXiv preprint arXiv:2602.08006},
  year   = {2026}
}