中文

面向环境异构的联邦策略优化的客户端选择

机器学习 2025-06-03 v7

摘要

策略迭代(PI)的发展启发了近期许多强化学习(RL)算法,包括若干在多种任务上获得理论严谨性与实证成功的策略梯度方法。PI的理论在集中式学习背景下已较为丰富,但其在联邦设置下的研究仍处于起步阶段。本文研究了近似PI(API)的联邦版本,并推导了其误差界,同时考虑了由环境异构引入的近似误差。我们从理论上证明,恰当的客户端选择方案能够减小该误差界。基于理论结果,我们提出了一种客户端选择算法,以缓解由环境异构引起的额外近似误差。实验结果表明,所提算法在联邦山地车问题、Mujoco Hopper问题和基于SUMO的自动驾驶车辆训练问题上,通过从总体分布中有效选择异构程度较低的客户端,优于其他有偏和无偏客户端选择方法。

关键词

引用

@article{arxiv.2305.10978,
  title  = {Client Selection for Federated Policy Optimization with Environment Heterogeneity},
  author = {Zhijie Xie and Shenghui Song},
  journal= {arXiv preprint arXiv:2305.10978},
  year   = {2025}
}