中文

利用虚拟多视角增强单目室内语义场景完成:Fake It To Make It

计算机视觉与模式识别 2025-03-10 v1 机器学习

摘要

单目室内语义场景完成(SSC)旨在从单一的室内 RGB 图像重建 3D 语义占用图,通过 2D 图像线索推断空间布局和物体类别。在将 2D 图像转化为 3D 空间时,尤其在室内场景中常存在深度、尺度和形状歧义,尤其在复杂且常常高度遮蔽的室内环境中更为突出。当前 SSC 方法在面对这些歧义时往往难以克服,导致物体表示失真或缺失。为克服这些限制,我们提出一种创新方法,利用新视角合成和多视角融合。具体而言,我们演示如何在场景周围放置虚拟相机,以模拟多视角输入以增强场景的上下文信息。我们还引入一种多视角融合适配器(MVFA),有效地将多视角 3D 场景预测融合为统一的 3D 语义占用图。最后,我们确定并研究了生成技术在 SSC 中的内在局限性,即新颖性-一致性权衡。我们的系统 GenFuSE 在 NYUv2 数据集上集成到现有 SSC 网络中后,场景完成 IoU 分数提升最高可达 2.8%,语义场景完成 IoU 分数提升最高可达 4.9%。本工作将 GenFuSE 引入作为单目 SSC 基于合成输入的标准框架。

关键词

引用

@article{arxiv.2503.05086,
  title  = {Fake It To Make It: Virtual Multiviews to Enhance Monocular Indoor Semantic Scene Completion},
  author = {Anith Selvakumar and Manasa Bharadwaj},
  journal= {arXiv preprint arXiv:2503.05086},
  year   = {2025}
}

备注

Submitted to IROS 2025