中文

用于三维场景抽象的鲁棒形状拟合

计算机视觉与模式识别 2024-03-18 v1

摘要

人类将世界感知并构建为简单参数模型的排列。特别地,我们通常可以使用长方体或圆柱体等体积基元来描述人造环境。推断这些基元对于获得高层次的抽象场景描述非常重要。以往基于基元的抽象方法直接估计形状参数,且仅能重现简单物体。相比之下,我们提出了一种用于基元拟合的鲁棒估计器,能够使用长方体有意义地抽象复杂的真实世界环境。由神经网络引导的 RANSAC 估计器将这些基元拟合至深度图。我们以场景中先前检测到的部分为条件约束网络,对其进行逐一解析。为了从单张 RGB 图像中获取长方体,我们额外端到端地优化了一个深度估计 CNN。直接最小化点到基元的距离会导致产生遮挡场景部分的大型或虚假长方体。因此,我们提出了一种改进的遮挡感知距离度量,以正确处理不透明场景。此外,我们提出了一种基于神经网络的长方体求解器,在减少推理时间的同时提供了更简洁的场景抽象。所提算法在训练时不需要如长方体标注等耗费大量人力的标签。在 NYU Depth v2 数据集上的结果表明,所提算法成功抽象了杂乱的真实世界三维场景布局。

关键词

引用

@article{arxiv.2403.10452,
  title  = {Robust Shape Fitting for 3D Scene Abstraction},
  author = {Florian Kluger and Eric Brachmann and Michael Ying Yang and Bodo Rosenhahn},
  journal= {arXiv preprint arXiv:2403.10452},
  year   = {2024}
}

备注

Accepted for publication in Transactions on Pattern Analysis and Machine Intelligence (PAMI). arXiv admin note: substantial text overlap with arXiv:2105.02047