中文

基于语义因果感知的视觉式 3D 占据预测

计算机视觉与模式识别 2025-09-11 v1 人工智能

摘要

视觉式 3D 语义占据预测是 3D 视觉中集成体积 3D 重建与语义理解的关键任务。现有方法通常依赖模块化管道,这些模块通常独立优化或使用预配置的输入,导致级联误差。本文通过设计一种新型因果损失,实现了模块化 2D 到 3D 转换管道的整体、端到端监督。该损失基于 2D 到 3D 语义因果原理,调节从 3D 体素表示回到 2D 特征的梯度流动。因此,它使整个管道可微,统一学习过程,使此前不可训练的组件完全可学习。基于这一原理,我们提出了语义因果感知 2D 到 3D 转换方法,由三个组件组成,这些组件由我们的因果损失驱动:信道分组提升(Channel-Grouped Lifting)实现自适应语义映射、可学习相机偏移(Learnable Camera Offsets)提高对相机扰动的鲁棒性,以及标准化卷积(Normalized Convolution)有效特征传播。广泛的实验表明,我们的方法在 Occ3D 数据集上实现了最先进的性能,显示出对相机扰动的显著鲁棒性和改进的 2D 到 3D 语义一致性。

关键词

引用

@article{arxiv.2509.08388,
  title  = {Semantic Causality-Aware Vision-Based 3D Occupancy Prediction},
  author = {Dubing Chen and Huan Zheng and Yucheng Zhou and Xianfei Li and Wenlong Liao and Tao He and Pai Peng and Jianbing Shen},
  journal= {arXiv preprint arXiv:2509.08388},
  year   = {2025}
}

备注

ICCV 2025