中文

FM-Loc:利用基础模型改进基于视觉的定位

机器人学 2023-04-17 v1

摘要

视觉位置识别对于基于视觉的机器人定位与 SLAM 至关重要。尽管近年来取得巨大进展,变化环境中的位置识别仍具挑战性。应对外观变化的一种有前景方法是利用物体或场所类别等高层语义特征。本文提出 FM-Loc,一种基于基础模型的新型图像定位方法,其结合大语言模型 GPT-3 与视觉-语言模型 CLIP 构建对场景几何与相机视角剧烈变化鲁棒的语义图像描述子。我们部署 CLIP 检测图像中物体,GPT-3 基于检测物体建议潜在房间标签,再次使用 CLIP 提出最可能位置标签。物体标签与场景标签构成图像描述子,用于计算查询与数据库图像间相似度分数。我们在真实世界数据上验证该方法,数据在数据库与查询轨迹间表现出显著的相机视角与物体摆放变化。实验结果表明,我们的方法适用于广泛室内场景,无需训练或微调。

关键词

引用

@article{arxiv.2304.07058,
  title  = {FM-Loc: Using Foundation Models for Improved Vision-based Localization},
  author = {Reihaneh Mirjalili and Michael Krawez and Wolfram Burgard},
  journal= {arXiv preprint arXiv:2304.07058},
  year   = {2023}
}