中文

WeatherPrompt:面向全天候无人机视觉地理定位的多模态表征学习

计算机视觉与模式识别 2025-12-05 v3 机器人学

摘要

无人机视觉地理定位在雨、雾等天气扰动下面临严重性能退化,现有方法受限于两个固有局限:1)严重依赖有限的天气类别,限制了泛化能力;2)通过伪天气类别对纠缠的场景-天气特征进行解耦的效果欠佳。我们提出了WeatherPrompt,这是一种多模态学习范式,通过融合图像嵌入与文本上下文来建立天气不变的表征。我们的框架引入了两个关键贡献:首先,一种免训练的天气推理机制,利用现成的大型多模态模型通过类人推理合成多天气文本描述。这提高了对未见或复杂天气的可扩展性,并能反映不同的天气强度。其次,为了更好地解耦场景和天气特征,我们提出了一种多模态框架,该框架具有由文本嵌入驱动的动态门控机制,以自适应地重新加权和融合跨模态的视觉特征。该框架进一步通过跨模态目标进行优化,包括图像-文本对比学习和图像-文本匹配,这将不同天气条件下的同一场景在表征空间中映射得更近。大量实验验证,在多样的天气条件下,我们的方法取得了与最先进的无人机地理定位方法相比具有竞争力的召回率。值得注意的是,在夜间条件下,它将Recall@1提高了+13.37%,在雾和雪条件下提高了18.69%。

关键词

引用

@article{arxiv.2508.09560,
  title  = {WeatherPrompt: Multi-modality Representation Learning for All-Weather Drone Visual Geo-Localization},
  author = {Jiahao Wen and Hang Yu and Zhedong Zheng},
  journal= {arXiv preprint arXiv:2508.09560},
  year   = {2025}
}