FedUMM:基于统一多模态模型的联邦学习通用框架
机器学习
2026-01-23 v1
摘要
统一多模态模型(UMM)正逐渐成为强大的基础模型,能够在单一架构中同时执行生成与理解任务。然而,它们通常在集中式环境中训练,即所有训练与下游数据集均汇聚于中央服务器,这限制了其在隐私敏感及地理分布式场景中的部署。本文提出 FedUMM,一个面向非独立同分布(non-IID)多模态数据且通信成本较低的 UMM 通用联邦学习框架。FedUMM 基于 NVIDIA FLARE 构建,通过参数高效微调为 BLIP3o 主干网络实例化联邦过程:客户端训练轻量级 LoRA 适配器并冻结基础模型,服务器仅聚合适配器更新。我们在 Dirichlet 控制的异构性设置下,于最多 16 个客户端上对 VQA v2 和 GenEval 组合生成基准进行了评估。结果表明,尽管性能随客户端数量与异构性增加而略有下降,但仍保持与集中式训练相当的竞争力。我们进一步分析了计算与通信的权衡,证明仅适配器联邦相比全量微调可将每轮通信减少一个数量级以上,从而实现实用的联邦 UMM 训练。本工作为未来隐私保护的联邦统一多模态模型研究提供了实证经验。
引用
@article{arxiv.2601.15390,
title = {FedUMM: A General Framework for Federated Learning with Unified Multimodal Models},
author = {Zhaolong Su and Leheng Zhao and Xiaoying Wu and Ziyue Xu and Jindong Wang},
journal= {arXiv preprint arXiv:2601.15390},
year = {2026}
}