中文

用于单张深度图像语义场景补全的视体网络

计算机视觉与模式识别 2018-06-15 v1

摘要

我们提出一种视体卷积神经网络(VVNet),用于从单张深度图像推断体积化3D场景的占据情况与语义标签。VVNet通过一个可微投影层将2D视图CNN与3D体CNN级联。给定单张RGBD图像,我们的方法利用2D视图CNN从输入深度图像中提取详细的几何特征,随后通过投影层依据输入深度图将特征投影至3D体中。之后,我们利用3D体CNN学习场景的3D上下文信息,以计算所得体积占据与语义标签。结合2D与3D表示,VVNet有效降低了计算成本,支持从多通道高分辨率输入中提取特征,从而显著提升结果精度。我们在合成SUNCG与真实NYU数据集上验证了方法,并展示了其效率与有效性。

关键词

引用

@article{arxiv.1806.05361,
  title  = {View-volume Network for Semantic Scene Completion from a Single Depth Image},
  author = {Yu-Xiao Guo and Xin Tong},
  journal= {arXiv preprint arXiv:1806.05361},
  year   = {2018}
}

备注

To appear in IJCAI 2018