中文

FM-Fusion: 由视觉-语言基础模型增强的实例感知语义建图

计算机视觉与模式识别 2024-11-01 v2 机器人学

摘要

基于有监督目标检测器的语义建图对图像分布敏感。在真实世界环境中,目标检测与分割性能可能会大幅下降,从而阻碍了语义建图在更广泛领域的应用。另一方面,视觉-语言基础模型的发展展现出了跨数据分布的强大零样本迁移能力。这为构建可泛化的实例感知语义图提供了机会。因此,本工作探讨了如何利用基础模型生成的目标检测结果来增强实例感知语义建图。我们提出了一种概率标签融合方法,从开集标签测量中预测闭集语义类别。一个实例细化模块合并了由不一致分割导致的过分割实例。我们将所有模块集成到一个统一的语义建图系统中。读取一系列 RGB-D 输入,我们的工作增量式地重建实例感知语义图。我们在 ScanNet 和 SceneNN 数据集上评估了该方法的零样本性能。我们的方法在 ScanNet 语义实例分割任务上取得了 40.3 的平均精度均值(mAP)。它显著优于传统的语义建图方法。

关键词

引用

@article{arxiv.2402.04555,
  title  = {FM-Fusion: Instance-aware Semantic Mapping Boosted by Vision-Language Foundation Models},
  author = {Chuhao Liu and Ke Wang and Jieqi Shi and Zhijian Qiao and Shaojie Shen},
  journal= {arXiv preprint arXiv:2402.04555},
  year   = {2024}
}

备注

Published in IEEE RAL