中文

Im2Pano3D:在视场之外外推 360 度结构与语义

计算机视觉与模式识别 2017-12-14 v1

摘要

我们提出 Im2Pano3D,一种卷积神经网络,当仅给定以 RGB-D 图像形式的部分观测(≤ 50%)时,它为室内场景的完整 360 度全景视图生成 3D 结构的密集预测以及语义标签的概率分布。为使这成为可能,Im2Pano3D 利用了从大规模合成与真实世界室内场景学到的强上下文先验。为简化 3D 结构的预测,我们提出用平面方程参数化 3D 表面,并训练模型直接预测这些参数。为提供有意义的训练监督,我们使用多个考虑像素级精度与全局上下文一致性的损失函数。实验表明,Im2Pano3D 能够以超过 56% 的像素准确率和小于 0.52m 的平均距离误差预测未观测场景的语义与 3D 结构,显著优于替代方法。

关键词

引用

@article{arxiv.1712.04569,
  title  = {Im2Pano3D: Extrapolating 360 Structure and Semantics Beyond the Field of View},
  author = {Shuran Song and Andy Zeng and Angel X. Chang and Manolis Savva and Silvio Savarese and Thomas Funkhouser},
  journal= {arXiv preprint arXiv:1712.04569},
  year   = {2017}
}

备注

Video summary: https://youtu.be/Au3GmktK-So