映射未见之物:利用基础模型进行统一可提示全景建图与动态标注
计算机视觉与模式识别
2026-02-04 v5 人工智能
机器人学
摘要
全景地图使机器人能够同时推理几何和语义。然而,开放词汇模型反复产生密切相关的标签,这些标签会分割全景实体并降低体积一致性。所提出的 UPPM 通过利用基础模型引入一种全景动态描述符,该描述符将开放词汇标签与统一的类别结构和几何尺寸先验相协调,从而推进了开放世界场景理解。此类动态描述符的融合是在多分辨率多 TSDF 地图中,使用语言引导的开放词汇全景分割和语义检索进行的,从而得到一个无需额外模型训练的持久且可提示的全景地图。基于我们的评估实验,UPPM 在地图重建精度和全景分割质量方面显示出最佳的整体性能。消融研究调查了 UPPM 每个组件(自定义 NMS、模糊帧过滤和统一语义)对整体系统性能的贡献。因此,UPPM 在保持开放词汇可解释性的同时,提供了强大的几何和全景精度。
引用
@article{arxiv.2405.02162,
title = {Mapping the Unseen: Unified Promptable Panoptic Mapping with Dynamic Labeling using Foundation Models},
author = {Mohamad Al Mdfaa and Raghad Salameh and Geesara Kulathunga and Sergey Zagoruyko and Gonzalo Ferrer},
journal= {arXiv preprint arXiv:2405.02162},
year = {2026}
}