VLG-Loc:基于标注足迹地图的视觉语言全局定位
机器人学
2025-12-19 v2
摘要
本文提出了VLG-Loc(视觉语言全局定位),一种利用仅包含环境中显著视觉地标名称和面积的标注足迹地图的新型全局定位方法。虽然人类自然地使用此类地图进行自我定位,但将这种能力转化为机器人系统仍然极具挑战性,因为在没有几何和外观细节的情况下,难以建立观测地标与地图中地标之间的对应关系。为应对这一挑战,VLG-Loc利用视觉语言模型(VLM)在机器人的多方向图像观测中搜索地图中标注的地标。该方法随后在蒙特卡洛定位框架内识别机器人位姿,其中找到的地标用于评估每个位姿假设的似然。在模拟和真实零售环境中的实验验证表明,该方法在环境变化下相比现有的基于扫描的方法具有优越的鲁棒性。通过视觉和基于扫描的定位的概率融合,进一步提升了性能。
引用
@article{arxiv.2512.12793,
title = {VLG-Loc: Vision-Language Global Localization from Labeled Footprint Maps},
author = {Mizuho Aoki and Kohei Honda and Yasuhiro Yoshimura and Takeshi Ishita and Ryo Yonetani},
journal= {arXiv preprint arXiv:2512.12793},
year = {2025}
}
备注
v2: Updated the citation of SparseLoc from an arXiv preprint to its published version in the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)