面对对手的联邦策略梯度方法的全局收敛保证
机器学习
2024-11-06 v2 人工智能
最优化与控制
摘要
联邦强化学习 (FRL) 允许多个代理人在不共享原始轨迹的情况下协同构建决策制定策略。然而,如果其中一小部分代理人为对手性代理人,则可能导致灾难性结果。我们提出一种对对手性代理人具有鲁棒性的策略梯度方法,这些代理人可向服务器发送任意值。在此设置下,我们的结果提供了具有一般参数化的首个全局收敛保证。这些结果表明即使面对对手,也能够实现对数 的最优样本复杂度,其中 为代理人总数, 为对手代理人数量。
引用
@article{arxiv.2403.09940,
title = {Global Convergence Guarantees for Federated Policy Gradient Methods with Adversaries},
author = {Swetha Ganesh and Jiayu Chen and Gugan Thoppe and Vaneet Aggarwal},
journal= {arXiv preprint arXiv:2403.09940},
year = {2024}
}
备注
25 pages, 14 figures and 1 table