中文

重访长方体:从单张 RGB 图像学习鲁棒的 3D 形状拟合

计算机视觉与模式识别 2021-05-06 v1

摘要

人类将周围世界感知并构建为简单参数化模型的排列。特别地,人造环境通常由长方体或圆柱体等体积基元组成。推断这些基元是获得高层抽象场景描述的重要一步。先前的方法直接从 2D 或 3D 输入估计形状参数,仅能复现简单物体,却无法准确解析更复杂的 3D 场景。相比之下,我们提出一种用于基元拟合的鲁棒估计器,其可利用长方体有意义地抽象真实世界环境。由神经网络引导的 RANSAC 估计器将这些基元拟合到 3D 特征(如深度图)上。我们以场景先前检测到的部分为条件,从而逐一解析场景。为从单张 RGB 图像获取 3D 特征,我们还以端到端方式优化一个特征提取 CNN。然而,朴素地最小化点到基元距离会导致过大或虚假的长方体遮挡其后方的场景部分。因此我们提出一种遮挡感知距离度量,可正确处理不透明场景。所提算法无需诸如长方体标注等耗费人力的标签进行训练。在具有挑战性的 NYU Depth v2 数据集上的结果表明,所提算法能成功抽象杂乱的真实世界 3D 场景布局。

关键词

引用

@article{arxiv.2105.02047,
  title  = {Cuboids Revisited: Learning Robust 3D Shape Fitting to Single RGB Images},
  author = {Florian Kluger and Hanno Ackermann and Eric Brachmann and Michael Ying Yang and Bodo Rosenhahn},
  journal= {arXiv preprint arXiv:2105.02047},
  year   = {2021}
}

备注

CVPR 2021