中文

FedRSClip:基于视觉语言模型的遥感场景分类联邦学习

计算机视觉与模式识别 2025-01-07 v1 人工智能

摘要

遥感数据常常分布在多个机构之间,由于隐私 concerns 和数据共享限制,在集中训练框架中利用大规模数据集具有挑战性。联邦学习提供了一条在分布式数据源之间进行协作模型训练且无需数据集中化的可行方案。然而,当前视觉语言模型 (VLM),通常包含数十亿参数,对基于模型参数更新的传统联邦学习方法来说会带来显著的通信挑战。本文提出了 FedRSClip,首个针对遥感图像分类设计的联邦学习框架,具体针对 VLM(CLIP)进行设计。FedRSClip 通过引入提示学习,仅优化少量可调参数,以解决联邦环境下数据异构性和大规模模型传输的挑战。该框架引入双提示机制,包括用于全局知识共享的共享提示和用于客户端特定适应的私有提示。为维持共享提示与私有提示之间的语义一致性,我们提出了双提示对齐约束,以在不同客户端分布中实现全局一致性和本地适应性之间的平衡。此外,为增强跨模态表征学习,我们引入了跨模态特征对齐约束,以对齐文本和图像提示之间的多模态特征。为验证我们所提出模型的有效性,我们构建了一个基于三个现有遥感图像分类数据集的 Fed-RSIC 数据集,旨在模拟各种联邦学习配置。实验结果表明,FedRSClip 在遥感图像分类方面的有效性和优越性。

关键词

引用

@article{arxiv.2501.02461,
  title  = {FedRSClip: Federated Learning for Remote Sensing Scene Classification Using Vision-Language Models},
  author = {Hui Lin and Chao Zhang and Danfeng Hong and Kexin Dong and Congcong Wen},
  journal= {arXiv preprint arXiv:2501.02461},
  year   = {2025}
}