FedMVP:面向视觉语言模型的联邦多模态视觉提示调优
计算机视觉与模式识别
2025-09-03 v2
摘要
在联邦学习中,文本提示调优通过在本地客户端数据上调谙轻量级输入标记(或提示),而保持网络权重冻结的方式来适配视觉语言模型(如CLIP)。训练后,仅共享这些提示由客户端与中心服务器进行聚合。然而,文本提示调优会对已知概念产生过拟合,限制其对未知概念的通用性。为解决这一局限性,我们提出了多模态视觉提示调优 (FedMVP),其条件化了来自输入图像和类文本属性特征的多模态上下文信息。FedMVP的核心是PromptFormer模块,通过交叉注意力机制 synergistically 对齐文本和视觉特征。生成的动态多模态视觉提示随后输入到冻结的视觉编码器中,并结合CLIP相似度损失和一致性损失进行训练。在覆盖三个通用设置的20个数据集上的广泛评估表明,FedMVP不仅保留了在分布类和域上的性能,还显示出对未知类和域的更高通用性,显著超过最新方法,提升幅度为 +1.57% - 2.26%。代码可在 https://github.com/mainaksingha01/FedMVP 获取。
引用
@article{arxiv.2504.20860,
title = {FedMVP: Federated Multimodal Visual Prompt Tuning for Vision-Language Models},
author = {Mainak Singha and Subhankar Roy and Sarthak Mehrotra and Ankit Jha and Moloud Abdar and Biplab Banerjee and Elisa Ricci},
journal= {arXiv preprint arXiv:2504.20860},
year = {2025}
}
备注
Accepted in ICCV 2025