中文

遥感视觉语言基础模型的冗余感知预训练

计算机视觉与模式识别 2025-05-19 v1

摘要

通过对视觉语言模型 ( VLM ) 的预训练开发基础模型近日引起广泛关注。VLM 预训练旨在从大量图像-文本对中学习图像和语言之间的对齐。每个预训练图像通常与多个包含冗余信息的标题相关联 due to repeated or semantically similar phrases,导致预训练和推理时间增加。为克服这一问题,我们引入一种针对遥感 VLM 预训练的加权特征聚合 ( WFA ) 策略。我们的策略旨在从每个图像的多个标题中提取和利用互补信息,同时通过特征聚合与重要性加权来减少冗余。为了计算不同标题的自适应重要性权重,我们提出了两种技术:(i) 非参数唯一性和 (ii) 基于学习的注意力。在第一技术中,重要性权重基于标题的 BLEU 分数计算,以突出唯一句子并减少重复句子的影响。在第二技术中,重要性权重通过注意力机制学习,而无需依赖手工特征。对所提出 WFA 策略及两种技术在遥感文本-图像检索下游任务性能上的有效性进行了分析。实验结果表明,所提出的策略使遥感 VLM 的预训练在效率和效果方面均表现优异。基于实验分析,我们推导出根据下游任务要求和资源约束选择合适技术的指导方针。本工作的代码已公开于 https://git.tu-berlin.de/rsim/redundacy-aware-rs-vlm。

关键词

引用

@article{arxiv.2505.11121,
  title  = {Redundancy-Aware Pretraining of Vision-Language Foundation Models in Remote Sensing},
  author = {Mathis Jürgen Adler and Leonard Hackel and Gencer Sumbul and Begüm Demir},
  journal= {arXiv preprint arXiv:2505.11121},
  year   = {2025}
}

备注

Accepted at IEEE International Geoscience and Remote Sensing Symposium (IGARSS) 2025. Our code is available at https://git.tu-berlin.de/rsim/redundacy-aware-rs-vlm