中文

FedAPT:面向视觉-语言模型的联邦对抗提示微调

计算机视觉与模式识别 2025-09-10 v1

摘要

联邦提示微调(FPT)是一种用于跨客户端协同微调大型视觉-语言模型(VLM)的高效方法。然而,使用 FPT 微调的模型容易受到对抗攻击,导致下游任务中的误分类。在本工作中,我们引入了联邦对抗提示微调(FedAPT),这是一种旨在增强 FPT 对抗鲁棒性的新方法。我们识别了非独立同分布(non-IID)设置下 FedAPT 的一个关键问题:客户端与全局模型之间的类信息鸿沟。客户端仅依赖有限的本地标签信息来生成用于训练的对抗样本,而全局模型必须防御来自全局标签的对抗攻击。为解决此问题,我们提出了一种类感知提示生成器,从文本提示生成视觉提示。该生成器由作为“信标”的全局标签嵌入引导,该嵌入编码跨客户端标签信息以创建更具全局一致性的视觉提示。此外,我们提出了一种跨层生成器共享策略,以增强模型不同层间的提示耦合,进一步提升对抗鲁棒性。在多个图像分类数据集上的大量实验证明了 FedAPT 在提升对抗鲁棒性方面的优越性,以大幅优势优于现有方法。FedAPT 在跨域和跨数据集场景中也表现出卓越的泛化能力,表明其在实际应用中的有效性。

关键词

引用

@article{arxiv.2509.06992,
  title  = {FedAPT: Federated Adversarial Prompt Tuning for Vision-Language Models},
  author = {Kun Zhai and Siheng Chen and Xingjun Ma and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2509.06992},
  year   = {2025}
}

备注

ACM MM25