中文

FedMPT:面向联邦多标签提示调优的视觉-语言模型

人工智能 2026-05-28 v1

摘要

基于视觉-语言模型(VLM)的多标签识别(MLR)旨在利用其预训练知识以更好地适应复杂的识别场景,从而增强模型的鲁棒性。然而,对于需要联邦学习的真实去中心化应用而言,为每个拥有私有异构数据的客户端适配 VLM 可能导致模型对不相关的标签相关性过拟合,从而在遇到新样本时触发不相关的类别。为解决此问题,我们重新考虑基于因果模型的联邦学习用于 MLR,其中我们采用前门调整方法,通过放大先验标签共现的中间变量来解耦 MLR 建模过程。根据我们的分析,我们提出了FedMPT,即首个专为联邦 MLR 设计的方法。FedMPT 的核心思想是利用可泛化的条件来引导联邦 MLR 以缓解错误的标签激活。为实现这一点,FedMPT 引入一个由大型语言模型(LLM)驱动的管道来解码主导标签依赖关系的底层条件。此外,我们在条件丰富的提示和图像块之间引入最优传输,以发现多个区域级别的语义。最后,我们通过精心设计的门控机制从不同条件中生成协同预测。在多个基准数据集上的实验表明,我们的 proposed 方法在各种设置下取得竞争成绩,并优于 SOTA 方法。

关键词

引用

@article{arxiv.2605.28347,
  title  = {FedMPT: Federated Multi-label Prompt Tuning of Vision-Language Models},
  author = {Xucong Wang and Pengkun Wang and Zhe Zhao and Liheng Yu and Shuang Wang and Yang Wang},
  journal= {arXiv preprint arXiv:2605.28347},
  year   = {2026}
}

备注

16 pages, including 11 pages of main text and 5 pages of appendix; Accepted by CVPR2026