SceneGraphLoc:基于 3D 场景图的跨模态粗视觉定位
计算机视觉与模式识别
2024-07-15 v3
摘要
我们引入了一个新问题,即在由 3D 场景图数据库表示的多模态参考地图中对输入图像进行定位。这些图包含多种模态,包括对象级点云、图像、属性以及对象之间的关系,为依赖大量图像数据库的传统方法提供了一种轻量且高效的替代方案。鉴于可用的模态,所提出的方法 SceneGraphLoc 为场景图中的每个节点(即表示一个对象实例)学习一个固定大小的嵌入,从而能够与输入查询图像中可见的对象进行有效匹配。该策略显著优于其他跨模态方法,即使在不将图像纳入地图嵌入的情况下也是如此。当利用图像时,SceneGraphLoc 实现了接近依赖大型图像数据库的 SOTA 技术的性能,同时所需存储空间少三个数量级,运行速度快数个数量级。代码将公开。
引用
@article{arxiv.2404.00469,
title = {SceneGraphLoc: Cross-Modal Coarse Visual Localization on 3D Scene Graphs},
author = {Yang Miao and Francis Engelmann and Olga Vysotska and Federico Tombari and Marc Pollefeys and Dániel Béla Baráth},
journal= {arXiv preprint arXiv:2404.00469},
year = {2024}
}