中文

卫星图像中基于 LLM 引导查询嵌入细化的开放词汇目标物体检索——Open-SAT

计算机视觉与模式识别 2026-05-08 v1 人工智能 信息检索

摘要

在卫星应用中,用户查询常以开放式自然语言形式出现,超出固定的预定义类别。这一开放词汇性质为将相关图像瓷片与查询精准匹配提出了重大挑战,因为检索系统必须泛化到广泛的未见物体和概念。虽然视觉语言模型 (VLM) 如 CLIP 被广泛用于文本-图像检索,但即使经过精细调谐的变体也难以准确地将此类查询与卫星图像对齐。为此,我们提出 Open-SAT,一种在推断时运行的训练-free 查询嵌入细化算法,用于提高用户查询与卫星图像内容之间的对齐度。Open-SAT 使用 VLM 计算图像瓷片的嵌入向量,并存储在向量数据库中以实现高效检索。在查询时,它利用大型语言模型 (LLM) 通过融合感兴趣对象及其周围环境的上下文信息来细化文本嵌入。一种无阈值检索机制进一步提高了准确性和效率。在三个公开基准测试中,实验结果表明,Open-SAT 将 F1 分数提高了最高可达 16.04%,而检索的图像瓷片数量与基线相当。这些结果表明,Open-SAT 在开放词汇卫星图像检索中有效利用了 LLM 指导,无需额外训练或监督。

关键词

引用

@article{arxiv.2605.05344,
  title  = {Open-SAT: LLM-Guided Query Embedding Refinement for Open-Vocabulary Object Retrieval in Satellite Imagery},
  author = {Md Adnan Arefeen and Biplob Debnath and Ravi K. Rajendran and Murugan Sankaradas and Srimat T. Chakradhar},
  journal= {arXiv preprint arXiv:2605.05344},
  year   = {2026}
}