中文

RSVG-ZeroOV:探索遥感图像中零样本开放词汇视觉定位的无训练框架

计算机视觉与模式识别 2025-11-12 v2 人工智能

摘要

遥感视觉定位(RSVG)旨在根据自由形式的自然语言表达在遥感图像中定位目标。现有方法通常受限于闭集词汇,制约了其在开放世界场景中的适用性。尽管近期尝试利用通用基础模型解决开放词汇 RSVG 问题,但它们过度依赖昂贵的高质量数据集和耗时的微调。为了解决这些局限性,我们提出了 \textbf{RSVG-ZeroOV},一个无训练框架,旨在探索冻结的通用基础模型在零样本开放词汇 RSVG 中的潜力。具体而言,RSVG-ZeroOV 包含三个关键阶段:(i) 概览:我们利用视觉-语言模型(VLM)获取交叉注意力\footnote[1]{在本文中,尽管纯解码器 VLM 对所有 token 使用自注意力,但我们将图像-文本交互部分称为交叉注意力,以区别于纯视觉自注意力。}图,以捕捉文本查询与视觉区域之间的语义关联。(ii) 聚焦:通过利用扩散模型(DM)的细粒度建模先验,我们填补了常被 VLM 忽略的目标结构和形状信息空白。(iii) 演化:引入了一个简单而有效的注意力演化模块来抑制无关激活,从而在所指目标上生成纯净的分割掩码。无需繁琐的任务特定训练,RSVG-ZeroOV 提供了一种高效且可扩展的解决方案。大量实验表明,所提出的框架持续优于现有的弱监督和零样本方法。

关键词

引用

@article{arxiv.2509.18711,
  title  = {RSVG-ZeroOV: Exploring a Training-Free Framework for Zero-Shot Open-Vocabulary Visual Grounding in Remote Sensing Images},
  author = {Ke Li and Di Wang and Ting Wang and Fuyu Dong and Yiming Zhang and Luyao Zhang and Xiangyu Wang and Shaofeng Li and Quan Wang},
  journal= {arXiv preprint arXiv:2509.18711},
  year   = {2025}
}

备注

This work is accepted by AAAI 2026