FedMOA: 面向异构奖励的联邦 GRPO 个性化推理大语言模型
机器学习
2026-02-03 v1 分布式、并行与集群计算
摘要
组相对策略优化(GRPO)最近作为一种有效提升大型语言模型推理能力的方法通过在线多目标强化学习而崛起。尽管私有数据上的个性化训练日益重要,但传统强化学习对齐因维护独立评论家网络的开销,往往在设备端联邦学习中难以实现。GRPO 的无评论家架构使其在设备端训练可行,但过渡到联邦设置后引入系统性挑战:异构奖励定义、不平衡的多目标优化以及高训练成本。我们提出 FedMOA,一个面向异构奖励下的多目标对齐的联邦 GRPO 框架。FedMOA 通过超梯度下降实现的在线自适应加权机制稳定局部训练,当辅助目标饱和后优先考虑主要推理目标。在服务端,它利用任务和准确性感知的聚合策略以优先考虑高质量更新。在数学推理和代码生成基准测试中进行的实验表明,FedMOA 持续优于联邦平均,实现了最高可达 2.2% 的准确率提升,同时改善了全局性能、个性化和多目标平衡。
引用
@article{arxiv.2602.00453,
title = {FedMOA: Federated GRPO for Personalized Reasoning LLMs under Heterogeneous Rewards},
author = {Ziyao Wang and Daeun Jung and Yexiao He and Guoheng Sun and Zheyu Shen and Myungjin Lee and Ang Li},
journal= {arXiv preprint arXiv:2602.00453},
year = {2026}
}