MAG-VLAQ:用于跨视角地点识别的多模态空地查询聚合
计算机视觉与模式识别
2026-05-12 v1 机器人学
摘要
由于地面观测与空中参考之间存在严重的视角、模态和空间结构差异,多模态跨视角地点识别仍是计算机视觉和机器人学中的一项基础挑战。为应对这一挑战,我们提出了 MAG-VLAQ,一种用于多模态空地跨视角地点识别的基础模型增强查询聚合框架。具体而言,我们的方法利用预训练基础模型从地面和空中图像中提取密集视觉 token,并从地面 LiDAR 观测中提取富有表现力的几何 token。这些异构 token 随后被投影到共享嵌入空间以进行跨模态对齐与融合。作为我们的主要贡献,我们提出了 ODE-conditioned VLAQ,将基于常微分方程(ODE)的 RGB-LiDAR 融合与局部聚合查询向量(VLAQ)紧密耦合。在该设计中,VLAQ 查询中心根据融合的多模态状态进行动态调整。该机制使最终的全局描述子能够保留全局学习到的检索原型,同时对特定场景的视觉和几何证据保持响应性,从而显著提升空地匹配。在 KITTI360-AG 和 nuScenes-AG 上的大量实验验证了我们提出的 MAG-VLAQ 的有效性。值得注意的是,在 KITTI360-AG 上,我们的 MAG-VLAQ 几乎使最先进方法的性能翻倍,在卫星设置下实现了 61.1 的 Recall@1,而最接近的竞争方法仅为 34.5。
引用
@article{arxiv.2605.09418,
title = {MAG-VLAQ: Multi-modal Aerial-Ground Query Aggregation for Cross-View Place Recognition},
author = {Zhengyi Xu and Yuhang Ming and Zhihao Zhan and Hanyu Zhu and Javier Civera and Wanzeng Kong},
journal= {arXiv preprint arXiv:2605.09418},
year = {2026}
}
备注
16 pages, 4 figures, 3 tables