通过 LLM 指导注意力提升众包洪水图像的地理定位
计算与语言
2026-04-21 v3 人工智能
计算机视觉与模式识别
计算机与社会
摘要
众包社交媒体图像提供城市洪水的实时视觉证据,但常缺乏可靠的地理元数据以支援应急响应。现有的视觉地点识别 (VPR) 模型因跨源域迁移和视觉失真而难以进行地理定位。我们提出 VPR-AttLLM,一个模型无关的框架,将大语言模型 (LLM) 的语义推理与地理空间知识整合进 VPR 流程,通过注意力引导的描述符增强。VPR-AttLLM 使用 LLM 识别位置信息丰富区域并抑制瞬时噪声,从而提升检索效果,无需模型再训练或新增数据。我们在旧金山与香港使用既定查询、合成洪水情境及真实社交媒体洪水图像进行评估。将 VPR-AttLLM 与最先进模型 (CosPlace、EigenPlaces、SALAD) 集成后,召回率稳定提升,实验室测得 1-3% 的相对提升,挑战性真实洪水图像最高可达 8%。通过将城市感知原则嵌入注意力机制,VPR-AttLLM 将类人空间推理与现代 VPR 架构相结合。其即插即用设计与跨源鲁棒性为快速定位众包危机图像提供可扩展解决方案,推动认知城市韧性发展。
引用
@article{arxiv.2512.11811,
title = {Enhancing Geo-localization for Crowdsourced Flood Imagery via LLM-Guided Attention},
author = {Fengyi Xu and Jun Ma and Waishan Qiu and Cui Guo and Jack C. P. Cheng},
journal= {arXiv preprint arXiv:2512.11811},
year = {2026}
}
备注
Updated author list to include additional contributor. Revised title and improved methodology section based on collaborative feedback