无训练的多语言遥感图像描述生成
计算机视觉与模式识别
2025-12-04 v2
摘要
遥感图像描述生成通过 encoder-decoder 模型取得了快速进展,但依赖大量标注数据且仅聚焦于英语,限制了其全球适用性。为此,我们提出首个无训练的多语言方法,基于检索增强式提示。对于给定的航空图像,我们采用领域适配的 SigLIP2 编码器从数据存储库中检索相关描述和 few-shot 示例,然后提供给语言模型。我们探讨两种变体:一种是图像不敏感的 setup,即多语言大语言模型(LLM)仅从文本提示生成描述;另一种是图像感知的 setup,即视觉-语言模型(VLM)联合处理提示和输入图像。为提高检索内容的连贯性,我们引入基于 PageRank 的图式重排序策略,对图像和描述的图进行计算。在十种语言的四个基准数据集上进行实验,表明该方法在准确性上与完全监督的英语唯一系统相当,并能推广至其他语言。结果还表明,重排序策略的重要性,性能提升可达35%。此外,观察到虽然 VLM 倾向于生成具有视觉依托但词汇多样性较强的描述,但 LLM 能实现更高的 BLEU 和 CIDEr 分数。最后,直接生成目标语言的描述始终优于其他翻译策略。总体而言,我们提供了首个系统性评估多语言、无训练遥感图像描述生成的工作,推动了更具包容性和可扩展的地球观测多模态系统的发展。
引用
@article{arxiv.2512.00887,
title = {Multilingual Training-Free Remote Sensing Image Captioning},
author = {Carlos Rebelo and Gil Rocha and João Daniel Silva and Bruno Martins},
journal= {arXiv preprint arXiv:2512.00887},
year = {2025}
}