SSR-2D:从二维图像进行语义三维场景重建
计算机视觉与模式识别
2024-06-06 v4
摘要
大多数用于三维室内空间全面语义建模的深度学习方法需要在三维域中进行昂贵的密集标注。在这项工作中,我们探索了一个核心的三维场景建模任务,即不使用任何三维标注的语义场景重建。我们方法的关键思想是设计一个可训练的模型,该模型采用不完整的重建三维结果及其对应的源 RGB-D 图像,将跨域特征融合到体素嵌入中,仅利用可为人工或机器生成的二维标注来预测完整的三维几何、颜色与语义。我们的关键技术革新是利用颜色和语义的可微分渲染来桥接二维观测与未知三维空间,分别使用观测的 RGB 图像和二维语义作为监督。我们还开发了一个学习流程及相应方法,以从不完美的预测二维标签中学习,这些标签还可通过在扩充的虚拟训练视图集合中合成来补充原始真实捕获,从而实现更高效的语义自监督循环。因此,我们的端到端可训练方案从有限的 RGB-D 图像联合解决几何补全、着色与语义映射,而不依赖任何三维真值信息。我们的方法在两个大规模基准数据集 MatterPort3D 和 ScanNet 上取得了语义场景补全的 SOTA 性能,甚至在预测几何与语义时超越使用昂贵三维标注的基线。据我们所知,我们的方法也是首个同时处理真实世界三维扫描补全与语义分割的二维驱动方法。
引用
@article{arxiv.2302.03640,
title = {SSR-2D: Semantic 3D Scene Reconstruction from 2D Images},
author = {Junwen Huang and Alexey Artemov and Yujin Chen and Shuaifeng Zhi and Kai Xu and Matthias Nießner},
journal= {arXiv preprint arXiv:2302.03640},
year = {2024}
}