中文

利用 2D 监督学习 3D 场景先验

计算机视觉与模式识别 2022-11-28 v1

摘要

整体 3D 场景理解需要在 3D 环境中同时估计布局配置与物体几何。近期工作已展示从多种输入模态(如图像、3D 扫描)进行 3D 场景估计的进展,其依赖于 3D 监督(如 3D 边界框或 CAD 模型),而此类监督的大规模采集代价高昂且往往难以实现。为弥补这一不足,我们提出一种新方法,在无需任何 3D 真值的情况下学习布局与形状的 3D 场景先验。相反,我们依赖来自多视角 RGB 图像的 2D 监督。我们的方法将 3D 场景表示为一个潜向量,由此可渐进解码为一系列由类别、3D 边界框和网格表征的物体。借助训练得到的表征场景先验的自回归解码器,我们的方法可支持诸多下游应用,包括场景合成、插值与单视图重建。在 3D-FRONT 和 ScanNet 上的实验表明,我们的方法在单视图重建上优于当前最优方法,并在场景合成上相对于需要 3D 监督的基线取得当前最优结果。

关键词

引用

@article{arxiv.2211.14157,
  title  = {Learning 3D Scene Priors with 2D Supervision},
  author = {Yinyu Nie and Angela Dai and Xiaoguang Han and Matthias Nießner},
  journal= {arXiv preprint arXiv:2211.14157},
  year   = {2022}
}

备注

Video: https://youtu.be/YT7MEdygRoY Project: https://yinyunie.github.io/sceneprior-page/