中文

FedGRPO: 利用领域客户端的组相对奖励私有优化基础模型

机器学习 2026-02-13 v1

摘要

联邦基础模型(FedFMs)的一个重要方向是利用来自小型客户端模型的数据来增强大型服务器端基础模型的性能。现有的基于模型级或表示级知识迁移的方法,要么需要昂贵的本地训练,要么导致高通信成本并引入不可避免的隐私风险。我们将此问题重新表述为强化学习风格的评估过程,并提出FedGRPO,一个包含两个模块的隐私保护框架。第一个模块通过从辅助数据构建轻量级置信图来执行基于能力的专家选择,为每个问题识别最合适的客户端。第二个模块利用组相对策略优化(GRPO)框架中的“组相对”概念,将每个问题及其解决方案理由打包成候选策略,将这些策略分发给选定的专家客户端子集,并通过联邦组相对损失函数仅聚合产生的标量奖励信号。通过交换奖励值而非数据或模型更新,FedGRPO降低了隐私风险和通信开销,同时实现了跨异构设备的并行评估。在多样化领域任务上的实验结果表明,与传统的FedFMs基线相比,FedGRPO实现了优越的下游准确率和通信效率。

关键词

引用

@article{arxiv.2602.12014,
  title  = {FedGRPO: Privately Optimizing Foundation Models with Group-Relative Rewards from Domain Client},
  author = {Gongxi Zhu and Hanlin Gu and Lixin Fan and Qiang Yang and Yuxing Han},
  journal= {arXiv preprint arXiv:2602.12014},
  year   = {2026}
}

备注

Accepted by AAAI 2026 as Oral