面向环境异构的联邦策略优化的客户端选择
机器学习
2025-06-03 v7
摘要
策略迭代(PI)的发展启发了近期许多强化学习(RL)算法,包括若干在多种任务上获得理论严谨性与实证成功的策略梯度方法。PI的理论在集中式学习背景下已较为丰富,但其在联邦设置下的研究仍处于起步阶段。本文研究了近似PI(API)的联邦版本,并推导了其误差界,同时考虑了由环境异构引入的近似误差。我们从理论上证明,恰当的客户端选择方案能够减小该误差界。基于理论结果,我们提出了一种客户端选择算法,以缓解由环境异构引起的额外近似误差。实验结果表明,所提算法在联邦山地车问题、Mujoco Hopper问题和基于SUMO的自动驾驶车辆训练问题上,通过从总体分布中有效选择异构程度较低的客户端,优于其他有偏和无偏客户端选择方法。
引用
@article{arxiv.2305.10978,
title = {Client Selection for Federated Policy Optimization with Environment Heterogeneity},
author = {Zhijie Xie and Shenghui Song},
journal= {arXiv preprint arXiv:2305.10978},
year = {2025}
}