APPLeNet:基于视觉注意力参数化提示学习的少样本遥感图像泛化方法(使用CLIP)
计算机视觉与模式识别
2023-04-13 v1
摘要
近年来,以CLIP为代表的大规模视觉-语言模型(VLMs)的成功使其在各类计算机视觉任务中的使用日益增多。这些模型通过精心设计的指令性文本提示实现零样本推断,无需任务特定的监督。然而,VLMs在遥感(RS)泛化任务中的潜力尚未被充分发掘。为填补这一研究空白,我们提出了一种新颖的图像条件提示学习策略,称为视觉注意力参数化提示学习网络(APPLeNet)。APPLeNet强调多尺度特征学习在RS场景分类中的重要性,并为域泛化任务解耦视觉风格与内容基元。为此,APPLeNet结合了从视觉编码器不同层获得的视觉内容特征,以及从特定域批次的特征统计中获得的风格属性。进一步引入注意力驱动的注入模块,由这些信息生成视觉令牌。我们还引入了反相关正则化器,以确保令牌嵌入之间的区分性,因为该视觉信息与文本令牌相结合。为验证APPLeNet,我们整理了四个可用的RS基准,并针对三项域泛化任务引入了实验协议与数据集。我们的结果持续优于相关文献,代码见 https://github.com/mainaksingha01/APPLeNet
引用
@article{arxiv.2304.05995,
title = {APPLeNet: Visual Attention Parameterized Prompt Learning for Few-Shot Remote Sensing Image Generalization using CLIP},
author = {Mainak Singha and Ankit Jha and Bhupendra Solanki and Shirsha Bose and Biplab Banerjee},
journal= {arXiv preprint arXiv:2304.05995},
year = {2023}
}
备注
11 Pages, 6 figures, 8 tables, Accepted in Earth Vision (CVPR 2023)