FedVLMBench:视觉-语言模型联邦微调基准测试
机器学习
2025-06-12 v1 计算机视觉与模式识别
摘要
视觉-语言模型(VLMs)通过整合视觉和文本信息,在跨模态理解与生成方面展现了卓越能力。虽然指令调参和参数高效微调方法已显著提升了 VLMs 的泛化能力,但大多数现有方法依赖集中式训练,给部署在医疗等具有严格隐私要求的领域带来了挑战。近期研究已将联邦学习(FL)引入 VLM 微调以应对这些隐私问题,然而针对评估联邦微调策略、模型架构和任务泛化能力的全面基准仍然缺乏。在本工作中,我们提出了 FedVLMBench——首个针对 VLMs 联邦微调的系统性基准。FedVLMBench 集成了两种主流 VLM 架构(基于编码器的和无编码器的)、四种微调策略、五种 FL 算法、六种多模态数据集,涵盖四种跨域单任务场景和两种跨域多任务设置,覆盖四种不同的下游任务类别。通过广泛实验,我们揭示了 VLM 架构、微调策略、数据异质性和多任务联邦优化之间的关键交互。特别地,我们发现一个两层多层感知器(MLP)连接器与并发连接器和 LLM 调参的组合,是编码器型 VLMs 在 FL 中的最优配置。此外,当前 FL 方法在视觉中心任务上的数据异质性敏感度显著高于文本中心任务,这一结论在无编码器和编码器型 VLM 架构中均成立。我们的基准为研究社区提供了必要的工具、数据集和经验指导,为推进隐私保护的多模态基础模型联邦训练提供了标准化平台。
引用
@article{arxiv.2506.09638,
title = {FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models},
author = {Weiying Zheng and Ziyue Lin and Pengxin Guo and Yuyin Zhou and Feifei Wang and Liangqiong Qu},
journal= {arXiv preprint arXiv:2506.09638},
year = {2025}
}