中文

无三维监督学习三维物体形状与布局

计算机视觉与模式识别 2022-06-15 v1

摘要

一个三维场景由一组物体构成,每个物体具有形状以及给出其在空间中位置的布局。从二维图像理解三维场景是一个重要目标,在机器人与图形学中有应用。尽管在从单张图像预测三维形状和布局方面已有近期进展,大多数方法依赖三维真值进行训练,而大规模收集三维真值代价高昂。我们克服这些局限,提出一种方法,可在无任何真值形状或布局信息的情况下学习预测物体的三维形状与布局:相反,我们依赖具有二维监督的多视图图像,这类数据可更易于大规模收集。通过在 3D Warehouse、Hypersim 和 ScanNet 上的大量实验,我们证明我们的方法可扩展到大规模真实图像数据集,并且优于依赖三维真值的方法。在缺乏可靠三维真值的 Hypersim 和 ScanNet 上,我们的方法优于在更小且多样性更低的数据集上训练的有监督方法。

关键词

引用

@article{arxiv.2206.07028,
  title  = {Learning 3D Object Shape and Layout without 3D Supervision},
  author = {Georgia Gkioxari and Nikhila Ravi and Justin Johnson},
  journal= {arXiv preprint arXiv:2206.07028},
  year   = {2022}
}

备注

CVPR 2022, project page: https://gkioxari.github.io/usl/