中文

VOIC: Visible-Occluded Integrated Guidance for 3D Semantic Scene Completion

计算机视觉与模式识别 2026-04-07 v5

摘要

基于摄像机的 3D 语义场景完成 (SSC) 是自动驾驶和机器人场景理解中的关键任务。旨在从单张图像推断语义和几何的完整 3D 体素表示。现有方法通常专注于端到端的 2D 到 3D 特征提升和体素完成。然而,它们往往忽视了由单图像输入引起的高置信度可见区域感知与低置信度遮挡区域推理之间的相互干扰,这可能导致特征稀释和错误传播。为了应对这些挑战,我们引入一种离线的可见区域标签提取 (VRLE) 策略,显式地从稠密 3D 真实标签中提取可见区域的体素级监督。该策略纯化了两个互补子任务:可见区域感知和遮挡区域推理的监督空间。基于此思想,我们提出了可见-遮挡交互完成网络 (VOIC),一种新的双解码器框架,显式地将 SSC 解耦为可见区域语义感知和遮挡区域场景完成。VOIC 首先通过融合图像特征与深度-derived 占据信息构建基础 3D 体素表示。可见解码器专注于生成高保真的几何和语义先验,而遮挡解码器则利用这些先验并结合跨模态交互进行连贯的全局场景推理。在 SemanticKITTI 和 SSCBench-KITTI360 基准上进行的广泛实验表明,VOIC 在几何完成和语义分割精度方面均优于现有的单目 SSC 方法,实现了最先进的性能。

关键词

引用

@article{arxiv.2512.18954,
  title  = {VOIC: Visible-Occluded Integrated Guidance for 3D Semantic Scene Completion},
  author = {Zaidao Han and Risa Higashita and Jiang Liu},
  journal= {arXiv preprint arXiv:2512.18954},
  year   = {2026}
}