DGTRSD与DGTRS-CLIP:遥感图像-文本双粒度数据集与视觉语言基础模型对齐
计算机视觉与模式识别
2025-10-30 v2 人工智能
摘要
基于CLIP架构的视觉语言基础模型在遥感领域主要依赖短文本标题,往往导致语义表征不完整。虽然更长的标题传递更丰富的信息,但现有模型因文本编码能力有限难以有效处理。此外,缺乏将遥感图像与短文本和长文本标题均对齐的资源。为此,我们引入DGTRSD——双粒度遥感图像-文本数据集,其中每张图像配有短文本标题和长文本描述,为双粒度语义建模提供了坚实基础。基于此,我们进一步提出DGTRS-CLIP,一种双粒度课程学习框架,融合短文本和长文本监督,实现双粒度语义对齐。在四个典型的零样例任务上进行大量实验:长文本跨模态检索、短文本跨模态检索、图像分类和语义定位,结果显示DGTRS-CLIP在所有任务中均优于现有方法。代码已开源,地址为:https://github.com/MitsuiChen14/DGTRS。
引用
@article{arxiv.2503.19311,
title = {DGTRSD & DGTRS-CLIP: A Dual-Granularity Remote Sensing Image-Text Dataset and Vision Language Foundation Model for Alignment},
author = {Weizhi Chen and Yupeng Deng and Jin Wei and Jingbo Chen and Jiansheng Chen and Yuman Feng and Zhihao Xi and Diyou Liu and Kai Li and Yu Meng},
journal= {arXiv preprint arXiv:2503.19311},
year = {2025}
}