中文

面向遥感文本-图像检索的资源高效训练框架

计算机视觉与模式识别 2025-01-22 v1 信息检索

摘要

遥感文本-图像检索 (RSTIR) 旨在根据描述性文本从数据库中检索匹配的遥感 (RS) 图像。最近,大型视觉-语言预训练模型的快速发展为 RSTIR 提供了新的思路。然而,随着模型在 RSTIR 中的复杂性不断提升,先前的研究在迁移学习期间存在资源效率不足的问题。为此,我们提出了一种计算和内存高效检索 (CMER) 框架用于 RSTIR。为减少训练内存消耗,我们提出了 Focus-Adapter 模块,采用侧支结构。其聚焦层抑制小目标背景像素的干扰。同时,为了提高数据效能,我们将 RS 场景类别作为元数据设计了简洁的数据增强技术。场景标签增强利用土地覆盖类别的先验知识,缩小搜索空间。我们提出了负样本循环策略,使负样本池独立于 mini-batch 大小,提高了泛化性能且无需引入额外编码器。我们在公共数据集上进行了定量和定性实验,并扩展了具有先进方法的基准,表明 CMER 的竞争性。与最近的先进方法相比,CMER 在 RSITMD 上的整体检索性能提高 2%--5%。此外,我们的方法在内存消耗上降低了 49%,训练数据吞吐量提升 1.4 倍。CMER 的代码和数据集将发布于 https://github.com/ZhangWeihang99/CMER。

关键词

引用

@article{arxiv.2501.10638,
  title  = {A Resource-Efficient Training Framework for Remote Sensing Text--Image Retrieval},
  author = {Weihang Zhang and Jihao Li and Shuoke Li and Ziqing Niu and Jialiang Chen and Wenkai Zhang},
  journal= {arXiv preprint arXiv:2501.10638},
  year   = {2025}
}