中文

从单张深度图像进行语义场景补全

计算机视觉与模式识别 2016-11-29 v1

摘要

本文聚焦于语义场景补全,这是一项从单视图深度图观测中生成场景的完整 3D 体素表示(包含体素占据和语义标签)的任务。先前的工作分别考虑了深度图的场景补全和语义标注。然而,我们观察到这两个问题紧密交织。为了利用这两个任务的耦合特性,我们引入了语义场景补全网络 (SSCNet),这是一种端到端的 3D 卷积网络,以单张深度图像作为输入,同时输出相机视锥体中所有体素的占据和语义标签。我们的网络使用基于膨胀的 3D 上下文模块来有效地扩大感受野并实现 3D 上下文学习。为了训练我们的网络,我们构建了 SUNCG——一个手动创建的、带有密集体素标注的大规模合成 3D 场景数据集。我们的实验表明,联合模型优于分别处理每个任务的方法,并在语义场景补全任务上优于其他替代方法。

关键词

引用

@article{arxiv.1611.08974,
  title  = {Semantic Scene Completion from a Single Depth Image},
  author = {Shuran Song and Fisher Yu and Andy Zeng and Angel X. Chang and Manolis Savva and Thomas Funkhouser},
  journal= {arXiv preprint arXiv:1611.08974},
  year   = {2016}
}