中文

马尔可夫噪声与异构性下的联邦随机逼近:在强化学习中的应用

机器学习 2024-10-22 v2

摘要

由于强化学习算法以数据密集著称,从环境中采样观测的任务通常分散于多个智能体。然而,将这些观测从智能体传输至中心位置在通信成本上可能极其昂贵,且会损害各智能体局部行为策略的隐私。联邦强化学习是一种由NN个智能体协作学习全局模型而不共享各自数据与策略的框架。该全局模型是对应于NN个智能体的NN个局部算子平均的唯一不动点。每个智能体维护全局模型的局部副本并利用本地采样数据更新。本文中,我们表明通过智能体在求解该联合不动点问题时的精心协作,可快NN倍找到全局模型,即线性加速。我们首先提出具有马尔可夫噪声与异构性的联邦随机逼近通用框架,展示收敛的线性加速。然后将该框架应用于联邦强化学习算法,考察联邦同策略TD、异策略TD与QQ学习的收敛性。

关键词

引用

@article{arxiv.2206.10185,
  title  = {Federated Stochastic Approximation under Markov Noise and Heterogeneity: Applications in Reinforcement Learning},
  author = {Sajad Khodadadian and Pranay Sharma and Gauri Joshi and Siva Theja Maguluri},
  journal= {arXiv preprint arXiv:2206.10185},
  year   = {2024}
}

备注

80 pages, 0 figure, accepted to ICML 2022 for long presentation