MegaLoc:一个检索模型统御全局
计算机视觉与模式识别
2025-06-11 v3
摘要
从与给定查询相同的位置检索图像是多个计算机视觉任务的重要组成部分,例如视觉位置识别、地标检索、视觉定位、3D 重建和 SLAM。然而,现有的解决方案是专门为其中某一项任务构建的,当需求发生微小变化或遇到分布外数据时,往往会失效。本文结合了多种现有方法、训练技术和数据集,训练了一个名为 MegaLoc 的检索模型,使其在多个任务上均表现出色。我们发现 MegaLoc (1) 在大量视觉位置识别数据集上达到了 SOTA,(2) 在常见的地标检索数据集上取得了令人瞩目的结果,(3) 在 LaMAR 数据集上为视觉定位设定了新的 SOTA,在此我们仅将现有定位流程中的检索方法替换为该方法。MegaLoc 的代码可在 https://github.com/gmberton/MegaLoc 获取。
引用
@article{arxiv.2502.17237,
title = {MegaLoc: One Retrieval to Place Them All},
author = {Gabriele Berton and Carlo Masone},
journal= {arXiv preprint arXiv:2502.17237},
year = {2025}
}
备注
Tech Report