中文

C-SAW:面向遥感图像泛化的自监督提示学习

计算机视觉与模式识别 2023-11-28 v1

摘要

我们关注利用大规模预训练视觉-语言模型(VLM)CLIP 分析光学遥感图像时的域泛化与类泛化问题。尽管对比训练的 VLM 展现出令人印象深刻的零样本泛化性能,但在训练与测试涉及多样域时其效果受限。现有提示学习技术忽视了将域与内容信息纳入提示的重要性,导致处理此类多域数据时性能下降。为应对这些挑战,我们提出一种在确保域不变提示学习的同时增强视觉特征表达能力的方案。我们观察到 CLIP 的视觉编码器难以识别上下文图像信息,尤其在图像块被打乱时。该问题在光学遥感图像中尤为严重,因为地物覆盖类别呈现出明确的上下文外观。为此,我们引入 C-SAW,一种以自监督损失补充 CLIP 的方法,并采用一种强调视觉域与内容特定特征的新型提示学习技术。我们保持 CLIP 主干冻结,并为两个 CLIP 编码器引入一小组投影器以对比训练 C-SAW。实验结果证明了 C-SAW 在多个遥感基准和不同泛化任务上的优越性。

关键词

引用

@article{arxiv.2311.15812,
  title  = {C-SAW: Self-Supervised Prompt Learning for Image Generalization in Remote Sensing},
  author = {Avigyan Bhattacharya and Mainak Singha and Ankit Jha and Biplab Banerjee},
  journal= {arXiv preprint arXiv:2311.15812},
  year   = {2023}
}

备注

Accepted in ACM ICVGIP 2023