中文

提升、抛射、映射:面向无标签语义场景完成的基础掩码提升

计算机视觉与模式识别 2024-07-08 v1 机器人学

摘要

部署在城市环境中的自动移动机器人必须具备情境感知能力,即能够区分不同的语义实体,并且对遮挡具有鲁棒性。当前的方法,如语义场景完成(SSC),需要预先枚举类别并进行高昂的人工标注,而表征学习方法则放宽了这些假设,但对遮挡不够稳健,且学习的表征针对辅助任务进行优化。为了解决这些限制,我们提出了LSMap方法,通过将视觉基础模型中的掩码提升到更高维度,预测整个场景的连续、开放集的语义和高度感知表示,采用鸟瞰视角(BEV),包括动态实体下方的区域以及被遮挡区域。我们的模型仅需要一个RGBD图像,不需要人工标签,即可实时运行。我们定量地表明,我们的方法在语义和高度场景完成任务上,以微调方式 outperform于从头训练的现有模型。此外,我们表明我们的预训练表征在无监督语义场景完成方面优于现有的视觉基础模型。我们使用CODa数据集进行评估,该数据集是一个大规模的真实城市机器人数据集。补充可视化、代码、数据和预训练模型将很快公开。

关键词

引用

@article{arxiv.2407.03425,
  title  = {Lift, Splat, Map: Lifting Foundation Masks for Label-Free Semantic Scene Completion},
  author = {Arthur Zhang and Rainier Heijne and Joydeep Biswas},
  journal= {arXiv preprint arXiv:2407.03425},
  year   = {2024}
}

备注

17 pages, 6 figures, 2 Tables