GeoAlignCLIP:基于多粒度一致性学习提升遥感图像-语言细粒度对齐
计算机视觉与模式识别
2026-03-11 v1
摘要
视觉-语言预训练模型在桥接遥感影像与自然语言方面取得了显著进展。然而,现有方法往往难以有效整合多粒度的视觉与文本信息,主要依赖全局图像-文本对齐,限制了模型捕捉图像细粒度细节的能力,从而制约了其在复杂细粒度任务中的性能。为此,我们提出GeoAlignCLIP,一个统一框架,通过学习多粒度语义对齐并融合自模态一致性,实现遥感任务中的细粒度对齐,实现图像区域与文本概念之间的更精确的视觉-语义对齐。此外,我们构建了RSFG-100k数据集,包含场景描述、区域级标注以及具有挑战性的硬负样本,为模型训练提供层次化监督。大量实验表明,GeoAlignCLIP在多个公开遥感基准上均显著优于现有遥感特定方法,展现出更稳健和准确的细粒度视觉-语言对齐能力。
引用
@article{arxiv.2603.09566,
title = {GeoAlignCLIP: Enhancing Fine-Grained Vision-Language Alignment in Remote Sensing via Multi-Granular Consistency Learning},
author = {Xiao Yang and Ronghao Fu and Zhuoran Duan and Zhiwen Lin and Xueyan Liu and Bo Yang},
journal= {arXiv preprint arXiv:2603.09566},
year = {2026}
}