Im2Pano3D:在视场之外外推 360 度结构与语义
计算机视觉与模式识别
2017-12-14 v1
摘要
我们提出 Im2Pano3D,一种卷积神经网络,当仅给定以 RGB-D 图像形式的部分观测(≤ 50%)时,它为室内场景的完整 360 度全景视图生成 3D 结构的密集预测以及语义标签的概率分布。为使这成为可能,Im2Pano3D 利用了从大规模合成与真实世界室内场景学到的强上下文先验。为简化 3D 结构的预测,我们提出用平面方程参数化 3D 表面,并训练模型直接预测这些参数。为提供有意义的训练监督,我们使用多个考虑像素级精度与全局上下文一致性的损失函数。实验表明,Im2Pano3D 能够以超过 56% 的像素准确率和小于 0.52m 的平均距离误差预测未观测场景的语义与 3D 结构,显著优于替代方法。
引用
@article{arxiv.1712.04569,
title = {Im2Pano3D: Extrapolating 360 Structure and Semantics Beyond the Field of View},
author = {Shuran Song and Andy Zeng and Angel X. Chang and Manolis Savva and Silvio Savarese and Thomas Funkhouser},
journal= {arXiv preprint arXiv:1712.04569},
year = {2017}
}
备注
Video summary: https://youtu.be/Au3GmktK-So