面向自然场景单图像的全景 3D 解析
计算机视觉与模式识别
2021-12-01 v2
摘要
执行单图像整体理解与 3D 重建是计算机视觉的核心任务。本文提出了一个集成系统,能够从单张 RGB 图像对室内和室外场景执行密集场景标注、目标检测、实例分割、深度估计、3D 形状重建以及 3D 布局估计。我们将我们的系统命名为全景 3D 解析 (Panoptic3D),其中执行了全景分割(“stuff”分割与“things”检测/分割)以及 3D 重建。我们设计了一个在缺乏完整标注集情况下的分阶段系统 Panoptic3D (stage-wise)。此外,我们还提出了一个在具有完整标注集的合成数据集上训练的端到端流水线 Panoptic3D (end-to-end)。我们在室内 (3D-FRONT) 和室外 (COCO 和 Cityscapes) 场景上展示了结果。我们提出的全景 3D 解析框架指明了计算机视觉中一个有前景的方向。Panoptic3D 可应用于多种应用,包括自动驾驶、地图构建、机器人、设计、计算机图形学、人机交互以及增强现实。
引用
@article{arxiv.2111.03039,
title = {Towards Panoptic 3D Parsing for Single Image in the Wild},
author = {Sainan Liu and Vincent Nguyen and Yuan Gao and Subarna Tripathi and Zhuowen Tu},
journal= {arXiv preprint arXiv:2111.03039},
year = {2021}
}