中文

异构环境下联邦 Softmax 策略梯度的全局收敛速率研究

机器学习 2026-04-02 v2

摘要

我们给出了带有本地训练的原始和熵正则化联邦 softmax 随机策略梯度(FedPG)的全局收敛速率。我们证明 FedPG 在平均智能体价值方面收敛至近最优策略,其差距由异构性水平控制。值得注意的是,借助类投影算子,我们获得了具有显式常数的熵正则化策略梯度的首个收敛速率。我们的结果建立在对非凸目标的联邦平均新分析之上,该分析基于单智能体设定下的 Łojasiewicz 型不等式不适用于联邦目标这一观察。这揭示了单智能体与联邦强化学习之间的根本区别:单智能体最优策略可以是确定性的,而联邦目标可能本质上需要随机策略。

关键词

引用

@article{arxiv.2505.23459,
  title  = {On Global Convergence Rates for Federated Softmax Policy Gradient under Heterogeneous Environments},
  author = {Safwan Labbi and Paul Mangold and Daniil Tiapkin and Eric Moulines},
  journal= {arXiv preprint arXiv:2505.23459},
  year   = {2026}
}

备注

Preprint