中文

FreeOcc:基于基础模型的无训练全景占有预测

计算机视觉与模式识别 2026-03-09 v1

摘要

语义和全景占有预测为道路场景分析提供稠密的3D表示。当前基于摄像机的典型方法依赖高成本的稠密3D监督,或需在目标域数据上训练模型,限制了在未见环境中的部署。我们提出FreeOcc,一种利用预训练基础模型恢复语义与几何信息的无训练管道。FreeOcc提取多视图全景先验:采用可提示的基础分割模型获取每个视图的全景先验,并通过提示到分类学规则进行转换;使用重建基础模型获取度量3D点。深度和置信度感知的过滤将可靠标签提升至3D空间,随后通过确定性精炼堆栈在时间上融合并体素化。对于全景占有预测,实例通过拟合和合并稳健的当前视图3D框候选实现,实现无需任何学习3D模型的实例感知占有预测。在Occ3D-nuScenes数据集上,FreeOcc实现了16.9的mIoU和16.5的RayIoU,与最新方法的弱监督性能相当。当用作下游模型的伪标签生成管道时,可达21.1的RayIoU,超越了以前的最新弱监督基线。进一步地,FreeOcc为无训练和弱监督全景占有预测设定了新的基准,分别实现了3.1和3.9的RayPQ。这些结果凸显了基础模型驱动的感知在实现无训练3D场景理解方面的实际价值。

关键词

引用

@article{arxiv.2603.06166,
  title  = {FreeOcc: Training-free Panoptic Occupancy Prediction via Foundation Models},
  author = {Andrew Caunes and Thierry Chateau and Vincent Fremont},
  journal= {arXiv preprint arXiv:2603.06166},
  year   = {2026}
}

备注

14 pages