中文

VisHall3D:从重建可见区域到幻象不可见区域的单目语义场景完成

计算机视觉与模式识别 2025-07-28 v1

摘要

本文介绍了 VisHall3D,这是一个新颖的两阶段框架,用于单目语义场景完成,以解决现有方法中普遍存在的特征 entangled 和几何不一致的问题。VisHall3D 将场景完成任务分解为两个阶段:重建可见区域(vision)和推断不可见区域(hallucination)。在第一个阶段,引入了基于可见性的投影模块 VisFrontierNet,以准确描绘视野边界同时保持细粒度细节。在第二个阶段,采用 OcclusionMAE 幻象网络,通过噪声注入机制为不可见区域生成合理的几何结构。通过将场景完成解耦为这两个 distinct 阶段,VisHall3D 有效缓解了特征 entangled 和几何不一致,显著提高了重建质量。通过在两个具有挑战性的基准数据集上的大量实验验证了 VisHall3D 的有效性:SemanticKITTI 和 SSCBench-KITTI-360。VisHall3D 实现了最先进的性能,显著优于以前的方法,并为更准确可靠的场景理解铺平了在自动驾驶及其他应用领域的道路。

关键词

引用

@article{arxiv.2507.19188,
  title  = {VisHall3D: Monocular Semantic Scene Completion from Reconstructing the Visible Regions to Hallucinating the Invisible Regions},
  author = {Haoang Lu and Yuanqi Su and Xiaoning Zhang and Longjun Gao and Yu Xue and Le Wang},
  journal= {arXiv preprint arXiv:2507.19188},
  year   = {2025}
}