中文

仅以 2D 图像监督学习 3D 语义分割

计算机视觉与模式识别 2021-10-22 v1

摘要

随着近期城市建图与自动驾驶工作的增长,从搭载激光雷达扫描仪与彩色相机地面平台采集的原始 3D 数据呈爆发式增长。然而,由于标注成本高,真实 3D 语义分割标注在数量与地理多样性上均有限,且难以跨传感器迁移。相比之下,带有真实语义分割的大规模图像集合可轻易获取,且涵盖多样场景。本文中,我们研究如何仅使用这些带标注的 2D 图像集合来监督训练 3D 语义分割模型。我们的方法是从 2D 语义图像分割经多视图融合得到伪标签,并据此训练 3D 模型。我们解决了该方法中的若干新问题,包括如何筛选可信伪标签、如何对含稀有物体类别的 3D 场景采样,以及如何在训练中将来自 2D 图像的输入特征与伪标签解耦。所提出的网络架构 2D3DNet,在覆盖 5 大洲 20 个城市采集的激光雷达与图像的新城市数据集实验中,相较基线取得了显著更优的性能(+6.2–11.4 mIoU)。

关键词

引用

@article{arxiv.2110.11325,
  title  = {Learning 3D Semantic Segmentation with only 2D Image Supervision},
  author = {Kyle Genova and Xiaoqi Yin and Abhijit Kundu and Caroline Pantofaru and Forrester Cole and Avneesh Sud and Brian Brewington and Brian Shucker and Thomas Funkhouser},
  journal= {arXiv preprint arXiv:2110.11325},
  year   = {2021}
}

备注

Accepted to 3DV 2021 (Oral)