中文

面对对手的联邦策略梯度方法的全局收敛保证

机器学习 2024-11-06 v2 人工智能 最优化与控制

摘要

联邦强化学习 (FRL) 允许多个代理人在不共享原始轨迹的情况下协同构建决策制定策略。然而,如果其中一小部分代理人为对手性代理人,则可能导致灾难性结果。我们提出一种对对手性代理人具有鲁棒性的策略梯度方法,这些代理人可向服务器发送任意值。在此设置下,我们的结果提供了具有一般参数化的首个全局收敛保证。这些结果表明即使面对对手,也能够实现对数 O~(1Nϵ2(1+f2N))\tilde{\mathcal{O}}\left( \frac{1}{N\epsilon^2} \left( 1+ \frac{f^2}{N}\right)\right) 的最优样本复杂度,其中 NN 为代理人总数,f<N/2f<N/2 为对手代理人数量。

关键词

引用

@article{arxiv.2403.09940,
  title  = {Global Convergence Guarantees for Federated Policy Gradient Methods with Adversaries},
  author = {Swetha Ganesh and Jiayu Chen and Gugan Thoppe and Vaneet Aggarwal},
  journal= {arXiv preprint arXiv:2403.09940},
  year   = {2024}
}

备注

25 pages, 14 figures and 1 table