马尔可夫噪声与异构性下的联邦随机逼近:在强化学习中的应用
机器学习
2024-10-22 v2
摘要
由于强化学习算法以数据密集著称,从环境中采样观测的任务通常分散于多个智能体。然而,将这些观测从智能体传输至中心位置在通信成本上可能极其昂贵,且会损害各智能体局部行为策略的隐私。联邦强化学习是一种由个智能体协作学习全局模型而不共享各自数据与策略的框架。该全局模型是对应于个智能体的个局部算子平均的唯一不动点。每个智能体维护全局模型的局部副本并利用本地采样数据更新。本文中,我们表明通过智能体在求解该联合不动点问题时的精心协作,可快倍找到全局模型,即线性加速。我们首先提出具有马尔可夫噪声与异构性的联邦随机逼近通用框架,展示收敛的线性加速。然后将该框架应用于联邦强化学习算法,考察联邦同策略TD、异策略TD与学习的收敛性。
引用
@article{arxiv.2206.10185,
title = {Federated Stochastic Approximation under Markov Noise and Heterogeneity: Applications in Reinforcement Learning},
author = {Sajad Khodadadian and Pranay Sharma and Gauri Joshi and Siva Theja Maguluri},
journal= {arXiv preprint arXiv:2206.10185},
year = {2024}
}
备注
80 pages, 0 figure, accepted to ICML 2022 for long presentation