面向遥感领域的多语言视觉-语言预训练
计算机视觉与模式识别
2024-11-01 v1
摘要
基于对比语言-图像预训练(CLIP)的方法如今被广泛用于支持涉及遥感数据的视觉与语言任务,如跨模态检索。将CLIP适配到这一特定领域依赖于使用标准对比目标进行模型微调,使用现有的人工标注图像-标题数据集,或使用从遥感图像的其他标注(如目标类别)派生的图像-标题对生成的合成数据。不同的预训练机制受到的关注较少,仅有少数例外考虑了多语言输入。本工作提出了一种面向遥感领域的新型视觉与语言模型,探索了多语言CLIP模型的微调,并测试了使用基于对齐单个输入图像的局部和全局表示的自监督方法 alongside 标准CLIP目标。模型训练依赖于组装现有的遥感图像与英文标题配对的数据集,随后使用自动机器翻译转换为九种额外语言。我们表明翻译数据确实有帮助,例如改善了英文上的性能。我们所得到的模型——我们将其命名为遥感多语言CLIP(RS-M-CLIP)——在多种视觉与语言任务上取得了最先进结果,包括跨模态和多语言图像-文本检索以及零样本图像分类。
引用
@article{arxiv.2410.23370,
title = {Multilingual Vision-Language Pre-training for the Remote Sensing Domain},
author = {João Daniel Silva and Joao Magalhaes and Devis Tuia and Bruno Martins},
journal= {arXiv preprint arXiv:2410.23370},
year = {2024}
}
备注
Accepted at ACM SIGSPATIAL 2024 - Research Papers