从单张 RGBD 图像完成三维场景解析
计算机视觉与模式识别
2018-11-15 v2
摘要
视觉的一个主要目标是从传感器推断物体、表面及其布局的物理模型。本文中,我们旨在从一张 RGBD 图像解释室内场景。我们的表示编码了正交墙壁的布局与物体的范围,以类 CAD 的三维形状建模。我们解析场景的可见与遮挡部分以及所有可观察物体,产生完整的三维解析。此种场景解释对机器人与视觉推理有用,但因众所周知的分割挑战、高度遮挡以及室内场景物体的多样性而难以生成。我们采取数据驱动方法,生成潜在物体区域集合,与训练图像中的区域匹配,并转移与对齐关联的 3D 模型,同时鼓励对观测的拟合与空间一致性。我们使用支撑推断辅助解释,并提出一种利用卷积神经网络(CNNs)对区域分类并检索具相似形状物体的检索方案。我们在我们新标注的带精细 3D 形状的 NYUd v2 数据集上展示了方法的性能。
引用
@article{arxiv.1710.09490,
title = {Complete 3D Scene Parsing from an RGBD Image},
author = {Chuhang Zou and Ruiqi Guo and Zhizhong Li and Derek Hoiem},
journal= {arXiv preprint arXiv:1710.09490},
year = {2018}
}
备注
Accepted to International Journal of Computer Vision (IJCV), 2018 arXiv admin note: text overlap with arXiv:1504.02437