遥感图像-文本检索的表示差异桥接方法
计算机视觉与模式识别
2025-05-23 v1 信息检索
多媒体
摘要
遥感图像-文本检索 (RSITR) 通过建立图像和文本描述之间的语义关联,在地理信息解释、灾害监测和城市规划中发挥着关键作用。现有的 Parameter-Efficient Fine-Tuning (PEFT) 方法通常采用对称适配器结构来探索跨模态相关性。然而,文本模态的强判别性可能主导优化过程,抑制图像表示学习。显著的不平衡跨模态优化仍是提高模型性能的瓶颈。为此,本研究提出了一种用于 RSITR 任务的表示差异桥接 (RDB) 方法。一方面,设计了跨模态非对称适配器 (CMAA),以实现模态特定的优化并提高特征对齐。CMAA 包含视觉增强适配器 (VEA) 和文本语义适配器 (TSA)。VEA 通过差分注意力 (DA) 机制挖掘细粒度图像特征,而 TSA 则通过层次注意力 (HA) 机制识别关键文本语义。另一方面,本研究将传统单任务检索框架扩展为双任务优化框架,并开发了双任务一致性损失 (DTCL)。DTCL 通过交叉模态、分类和指数移动平均一致性约束的自适应加权组合,提高了跨模态对齐的鲁棒性。在 RSICD 和 RSITMD 数据集上的实验表明,所提出的 RDB 方法相较于最先进的 PEFT 方法在 mR 指标上提高了 6%-11%,相较于完整微调的 GeoRSCLIP 模型提高了 1.15%-2%。
引用
@article{arxiv.2505.16756,
title = {Representation Discrepancy Bridging Method for Remote Sensing Image-Text Retrieval},
author = {Hailong Ning and Siying Wang and Tao Lei and Xiaopeng Cao and Huanmin Dou and Bin Zhao and Asoke K. Nandi and Petia Radeva},
journal= {arXiv preprint arXiv:2505.16756},
year = {2025}
}