环境异构下的联邦强化学习
机器学习
2022-04-07 v1 机器学习
摘要
我们研究一个联邦强化学习(FedRL)问题,其中 个智能体协作学习单一策略而不共享其在智能体-环境交互期间收集的轨迹。我们强调环境异构的约束,即对应于这 个智能体的 个环境具有不同的状态转移。为获得在所有环境中优化整体性能的价值函数或策略函数,我们提出两种联邦 RL 算法,\texttt{QAvg} 与 \texttt{PAvg}。我们从理论上证明这些算法收敛到次优解,而该次优性取决于这 个环境的异构程度。此外,我们提出一种通过将 个环境嵌入 个向量来实现个性化的启发式方法。该个性化启发式不仅改善了训练,也允许对新环境更好的泛化。
引用
@article{arxiv.2204.02634,
title = {Federated Reinforcement Learning with Environment Heterogeneity},
author = {Hao Jin and Yang Peng and Wenhao Yang and Shusen Wang and Zhihua Zhang},
journal= {arXiv preprint arXiv:2204.02634},
year = {2022}
}
备注
Artificial Intelligence and Statistics 2022