中文

通过无监督体素分割将三维场景分解为物体

计算机视觉与模式识别 2021-04-05 v1 机器学习 机器学习

摘要

我们提出 ObSuRF,一种将场景单张图像转化为以一组神经辐射场(NeRFs)表示的三维模型的方法,每个 NeRF 对应一个不同物体。编码网络的一次前向传播输出一组描述场景中物体的潜向量。这些向量被独立地用于调节 NeRF 解码器,定义每个物体的几何与外观。我们通过推导一种新损失使学习在计算上更高效,该损失允许在 RGB-D 输入上训练 NeRF 而无需显式光线步进。在确认模型在三个二维图像分割基准上达到或优于当前最优后,我们将其应用于两个多物体三维数据集:多视角版 CLEVR,以及一个由 ShapeNet 模型填充场景的新数据集。我们发现,在 RGB-D 训练场景视图上训练 ObSuRF 后,它不仅能恢复单张输入图像所描绘场景的三维几何,还能将其分割为物体,尽管在此过程中未接收任何相关监督。

关键词

引用

@article{arxiv.2104.01148,
  title  = {Decomposing 3D Scenes into Objects via Unsupervised Volume Segmentation},
  author = {Karl Stelzner and Kristian Kersting and Adam R. Kosiorek},
  journal= {arXiv preprint arXiv:2104.01148},
  year   = {2021}
}

备注

15 pages, 3 figures. For project page with videos, see http://stelzner.github.io/obsurf/