中文

Actor-Critic 更新顺序对联邦强化学习中的 PPO 至关重要

机器学习 2025-06-03 v1

摘要

在联邦强化学习 (Federated Reinforcement Learning, FRL) 的背景下,应用近端策略优化 (Proximal Policy Optimization, PPO) 面临着与其 actor 和 critic 更新顺序相关的挑战,这是由于聚合步骤发生在连续迭代之间。具体而言,当局部 actor 基于局部 critic 估计进行更新时,算法容易受到数据异构性的影响。因此,PPO 中传统的更新顺序(先 critic,后 actor)可能会导致客户端之间出现异构的梯度方向,阻碍其收敛到全局最优策略。为了解决这个问题,我们提出了 FedRAC,它颠倒了更新顺序(先 actor,后 critic),以消除来自不同客户端的 critic 之间的分歧。理论分析表明,在温和条件下(即有界的异构性水平和准确的策略评估),FedRAC 的收敛界不受数据异构性的影响。实验结果表明,所提出的算法在五项实验中获得了更高的累积奖励并更快收敛,包括三个经典 RL 环境以及一个使用 SUMO 交通模拟器的高度异构自动驾驶场景。

关键词

引用

@article{arxiv.2506.01261,
  title  = {The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning},
  author = {Zhijie Xie and Shenghui Song},
  journal= {arXiv preprint arXiv:2506.01261},
  year   = {2025}
}