通过无监督体素分割将三维场景分解为物体
计算机视觉与模式识别
2021-04-05 v1 机器学习
机器学习
摘要
我们提出 ObSuRF,一种将场景单张图像转化为以一组神经辐射场(NeRFs)表示的三维模型的方法,每个 NeRF 对应一个不同物体。编码网络的一次前向传播输出一组描述场景中物体的潜向量。这些向量被独立地用于调节 NeRF 解码器,定义每个物体的几何与外观。我们通过推导一种新损失使学习在计算上更高效,该损失允许在 RGB-D 输入上训练 NeRF 而无需显式光线步进。在确认模型在三个二维图像分割基准上达到或优于当前最优后,我们将其应用于两个多物体三维数据集:多视角版 CLEVR,以及一个由 ShapeNet 模型填充场景的新数据集。我们发现,在 RGB-D 训练场景视图上训练 ObSuRF 后,它不仅能恢复单张输入图像所描绘场景的三维几何,还能将其分割为物体,尽管在此过程中未接收任何相关监督。
引用
@article{arxiv.2104.01148,
title = {Decomposing 3D Scenes into Objects via Unsupervised Volume Segmentation},
author = {Karl Stelzner and Kristian Kersting and Adam R. Kosiorek},
journal= {arXiv preprint arXiv:2104.01148},
year = {2021}
}
备注
15 pages, 3 figures. For project page with videos, see http://stelzner.github.io/obsurf/