中文

用偏好取代参数:面向异构视觉语言模型的联邦对齐

人工智能 2026-03-06 v2

摘要

视觉语言模型 (VLM) 在医疗和金融等隐私敏感领域具有广阔应用前景,但严格的数据共享限制使集中式训练难以实现。联邦学习 (FL) 通过实现去中心化训练缓解了这一问题,但实际部署面临因客户端计算资源、应用需求及模型架构差异导致的异构性挑战。我们认为,与其以数据替换模型参数 characterize FL 当前的局面,不如以参数替换偏好 represent 更可扩展且更隐私保护的未来。基于此视角,我们提出 MoR——一种基于 GRPO 的联邦对齐框架,采用 Mixture-of-Rewards 适用于异构 VLM。MoR 以 KL 正则化参考模型为初始化,每个客户端基于本地偏好标注训练奖励模型,以捕获特定评估信号而不暴露原始数据。为解决异构奖励的融合问题,我们引入基于路由的融合机制,自适应聚合客户端奖励信号。最后,服务器对混合奖励执行 GRPO,以优化基础 VLM。在三个公开 VQA 数据集上进行的实验表明,MoR 在泛化性、鲁棒性及跨客户端适应性方面 consistently 优于联邦对齐基线。我们的做法为在联邦设置下面向异构 VLM 的隐私保护对齐提供了可扩展解决方案。

关键词

引用

@article{arxiv.2602.00485,
  title  = {Replacing Parameters with Preferences: Federated Alignment of Heterogeneous Vision-Language Models},
  author = {Shule Lu and Yujing Wang and Hainan Zhang and Xiaoshan Yang and Hongwei Zheng and Yongxin Tong and Changsheng Xu and Zhiming Zheng},
  journal= {arXiv preprint arXiv:2602.00485},
  year   = {2026}
}

备注

Due to the need for substantial revisions, the authors believe that the paper should be retracted first.A revised version may be resubmitted