中文

FedVLM:通过联邦学习实现可扩展的个性化视觉-语言模型

计算机视觉与模式识别 2025-11-11 v2

摘要

视觉-语言模型(VLM)展示了令人印象深刻的零样本和少样本学习能力,使其对于多个下游任务至关重要。然而,大规模微调这些模型仍然具有挑战性,尤其是在数据分散且跨客户端非独立同分布的联邦环境中。现有的参数高效微调方法(如 LoRA)降低了计算开销,但在处理异构客户端数据时表现不佳,导致泛化能力欠佳。为应对这些挑战,我们提出了 FedVLM,一个联邦 LoRA 微调框架,它能够在保护模型隐私并减少对集中式训练依赖的同时,实现 VLM 的分散式自适应。为进一步解决数据异构性问题,我们引入了个性化 LoRA(pLoRA),它能够动态调整 LoRA 参数以适应每个客户端独特的数据分布,在保持全局模型聚合的同时显著提升局部自适应能力。在 RLAIF-V 数据集上的实验表明,与标准 LoRA 相比,pLoRA 将客户端特定性能提升了 24.5%,展示了在非独立同分布环境下的卓越自适应能力。FedVLM 为在联邦环境中微调 VLM 提供了一种可扩展且高效的解决方案,推动了分布式学习场景中的个性化自适应发展。

关键词

引用

@article{arxiv.2507.17088,
  title  = {FedVLM: Scalable Personalized Vision-Language Models through Federated Learning},
  author = {Arkajyoti Mitra and Afia Anjum and Paul Agbaje and Mert Pesé and Habeeb Olufowobi},
  journal= {arXiv preprint arXiv:2507.17088},
  year   = {2025}
}

备注

Accepted to ECAI 2025 Main Track