用偏好替换参数:面向异构视觉语言模型的联邦对齐
人工智能
2026-05-06 v1
摘要
视觉语言模型 (VLMs) 在医疗和金融等隐私敏感领域具有广阔的应用前景,但严格的数据共享限制使得集中训练难以实现。联邦学习通过实现去中心化训练来缓解这一问题,但在实际部署中由于客户端在计算资源、应用需求和模型架构方面的异构性面临挑战。在高度的模型和数据异构性下,用偏好协作取代参数聚合提供了更合适的接口,因为它无需直接交换参数或数据。为了此动机,我们提出MoR,一个结合GRPO与Mixture-of-Rewards用于异构VLMs的联邦对齐框架。在MoR中,每个客户端从本地偏好注释训练奖励模型,以捕获特定评估信号而无需暴露原始数据。为了组合这些异构的监督信号,MoR引入一种带有学习路由的Mixture-of-Rewards机制,根据输入和对齐目标自适应地融合客户端奖励模型。服务器随后使用GRPO并针对参考模型施加KL惩罚,以进行偏好对齐,从而无需客户端模型共享架构或参数。实验在多样化的公开视觉语言基准测试数据集上进行,结果表明MoR在泛化性和跨客户端适应性方面 consistently 超过联邦对齐基线。我们的ethods provides a scalable solution for privacy-preserving alignment of heterogeneous VLMs under federated settings。
引用
@article{arxiv.2605.03426,
title = {Replacing Parameters with Preferences: Federated Alignment of Heterogeneous Vision-Language Models},
author = {Shule Lu and Yujing Wang and Hainan Zhang and Xiaoshan Yang and Hongwei Zheng and Yongxin Tong and Changsheng Xu and Zhiming Zheng},
journal= {arXiv preprint arXiv:2605.03426},
year = {2026}
}