高效联邦 RLHF:基于零阶策略优化的分区符号随机方法
机器学习
2026-04-21 v1
摘要
本文考虑在资源受限代理(如边缘设备)的联邦学习环境下进行的人类反馈强化学习。我们提出一种高效联邦 RLHF 算法,命名为分区符号随机零阶策略优化(Par-SZPO)。该算法基于二进制扰动的零阶优化,天然具有低通信、计算和内存复杂度。我们的理论分析给出了 Par-SZPO 收敛速率的上界,表明其在样本复杂度上与集中式方法相当,但在策略更新迭代次数上收敛更快。实验结果表明,在四个 MuJoCo 强化学习任务上,Par-SZPO 对抗基于 FedAvg 的 RLHF 方法具有显著优势。
引用
@article{arxiv.2604.17747,
title = {Efficient Federated RLHF via Zeroth-Order Policy Optimization},
author = {Deyi Wang and Qining Zhang and Lei Ying},
journal= {arXiv preprint arXiv:2604.17747},
year = {2026}
}