中文

超越像素:面向遥感图像检索的无训练文本到文本框架

计算机视觉与模式识别 2025-12-12 v1 人工智能

摘要

遥感(RS)图像的语义检索是一项关键任务,面临“语义鸿沟”——即模型低层视觉特征与高层人类概念之间的差异。虽然大型视觉语言模型(Vision-Language Models, VLMs)为弥合这一鸿沟提供了可行之路,但现有方法往往依赖于高昂的、特定于领域的训练,且缺乏评估VLM生成文本在零样态检索上下文中实际实用性的基准。为此,本文引入了遥感丰富文本(Remote Sensing Rich Text, RSRT)数据集,包含每个图像的多个结构化标题。基于该数据集,我们提出了一种完全无训练的文本检索基准,称为TRSLLaVA。我们的 метод将跨模态检索重新表述为文本到文本(text-to-text, T2T)匹配问题,利用丰富的文本描述作为查询查询数据库中由VLM生成的标题,在统一的文本嵌入空间中进行匹配。该方法完全绕过模型训练或微调。在RSITMD和RSICD基准上的实验表明,我们的无训练方法在与最先进的监督模型方面具有高度的竞争力。例如,在RSITMD上,我们的方法实现了42.62%的平均召回率,几乎翻倍于标准零样态CLIP基线的23.86%,并超越了多个顶级监督模型。这一结果验证了通过结构化文本获取高质量语义表征,为遥感图像检索提供了一种强大且高性价比的范式。

关键词

引用

@article{arxiv.2512.10596,
  title  = {Beyond Pixels: A Training-Free, Text-to-Text Framework for Remote Sensing Image Retrieval},
  author = {J. Xiao and Y. Guo and X. Zi and K. Thiyagarajan and C. Moreira and M. Prasad},
  journal= {arXiv preprint arXiv:2512.10596},
  year   = {2025}
}

备注

6 pages, 1 figure