中文

FrogDogNet:基于傅里叶频率保留的视觉提示输出引导,用于CLIP遥感图像领域泛化

计算机视觉与模式识别 2025-04-24 v1

摘要

近年来,大规模视觉语言模型(VLM)如CLIP因其使用指令文本提示进行零样本推理而受到关注。虽然这些模型在一般计算机视觉任务中表现出色,但其在遥感(RS)领域的领域泛化潜力尚未得到充分探索。现有方法通过生成视觉提示标记来增强提示学习,但依赖于全图像特征,引入噪声和背景伪影,这些噪声在同一类别内会有所不同,导致误分类。为此,我们提出了FrogDogNet,一种集成傅里叶频率滤波和自注意力机制的新型提示学习框架,用于提高RS场景分类和领域泛化。FrogDogNet selectively保留不变的低频分量,消除噪声和无关背景,确保跨域的稳健特征表示。该模型首先通过投影和自注意力提取显著特征,然后应用基于频率的滤波以保留提示学习所需的关键结构信息。在四个遥感数据集和三个领域泛化任务上的大量实验表明,FrogDogNet在各种领域迁移任务中一致优于最先进的提示学习方法,显示出卓越的适应性。我们的发现凸显了基于频率的不变特征保留在泛化中的有效性,为更广泛的应用铺平了道路。我们的代码可在 https://github.com/HariseetharamG/FrogDogNet 查看。

关键词

引用

@article{arxiv.2504.16433,
  title  = {FrogDogNet: Fourier frequency Retained visual prompt Output Guidance for Domain Generalization of CLIP in Remote Sensing},
  author = {Hariseetharam Gunduboina and Muhammad Haris Khan and Biplab Banerjee},
  journal= {arXiv preprint arXiv:2504.16433},
  year   = {2025}
}