中文

APPLeNet:基于视觉注意力参数化提示学习的少样本遥感图像泛化方法(使用CLIP)

计算机视觉与模式识别 2023-04-13 v1

摘要

近年来,以CLIP为代表的大规模视觉-语言模型(VLMs)的成功使其在各类计算机视觉任务中的使用日益增多。这些模型通过精心设计的指令性文本提示实现零样本推断,无需任务特定的监督。然而,VLMs在遥感(RS)泛化任务中的潜力尚未被充分发掘。为填补这一研究空白,我们提出了一种新颖的图像条件提示学习策略,称为视觉注意力参数化提示学习网络(APPLeNet)。APPLeNet强调多尺度特征学习在RS场景分类中的重要性,并为域泛化任务解耦视觉风格与内容基元。为此,APPLeNet结合了从视觉编码器不同层获得的视觉内容特征,以及从特定域批次的特征统计中获得的风格属性。进一步引入注意力驱动的注入模块,由这些信息生成视觉令牌。我们还引入了反相关正则化器,以确保令牌嵌入之间的区分性,因为该视觉信息与文本令牌相结合。为验证APPLeNet,我们整理了四个可用的RS基准,并针对三项域泛化任务引入了实验协议与数据集。我们的结果持续优于相关文献,代码见 https://github.com/mainaksingha01/APPLeNet

关键词

引用

@article{arxiv.2304.05995,
  title  = {APPLeNet: Visual Attention Parameterized Prompt Learning for Few-Shot Remote Sensing Image Generalization using CLIP},
  author = {Mainak Singha and Ankit Jha and Bhupendra Solanki and Shirsha Bose and Biplab Banerjee},
  journal= {arXiv preprint arXiv:2304.05995},
  year   = {2023}
}

备注

11 Pages, 6 figures, 8 tables, Accepted in Earth Vision (CVPR 2023)