PanopticRecon:利用开放词汇实例分割实现零样态全景重建
计算机视觉与模式识别
2024-07-02 v1 机器人学
摘要
全景重建是 3D 场景理解中的一个具有挑战性的任务。然而,大多数现有方法严重依赖预训练的语义分割模型和已知的 3D 物体边界框进行 3D 全景分割,这在野生场景中不可用。本文提出了一种 novel 的零时态全景重建方法,用于从 RGB-D 图像场景中进行重建。对于零时态分割,我们利用开放词汇实例分割,但需面对部分标注和实例关联挑战。我们通过利用稠密广义特征传播部分标签,并构建 3D 实例图来解决这两个挑战。具体而言,我们利用部分标签学习广义语义特征的分类器,以提供稠密提炼特征的完整标签。此外,我们将实例关联问题形式化为 3D 实例图分割问题,充分利用场景几何先验和所有 2D 实例掩码,以推断全局唯一的伪 3D 实例 ID。我们的方法在室内数据集 ScanNet V2 和户外数据集 KITTI-360 上优于现有 SOTA 方法,证明了图分割方法和重建网络的有效性。
引用
@article{arxiv.2407.01349,
title = {PanopticRecon: Leverage Open-vocabulary Instance Segmentation for Zero-shot Panoptic Reconstruction},
author = {Xuan Yu and Yili Liu and Chenrui Han and Sitong Mao and Shunbo Zhou and Rong Xiong and Yiyi Liao and Yue Wang},
journal= {arXiv preprint arXiv:2407.01349},
year = {2024}
}