中文

环境异构下的联邦强化学习

机器学习 2022-04-07 v1 机器学习

摘要

我们研究一个联邦强化学习(FedRL)问题,其中 nn 个智能体协作学习单一策略而不共享其在智能体-环境交互期间收集的轨迹。我们强调环境异构的约束,即对应于这 nn 个智能体的 nn 个环境具有不同的状态转移。为获得在所有环境中优化整体性能的价值函数或策略函数,我们提出两种联邦 RL 算法,\texttt{QAvg} 与 \texttt{PAvg}。我们从理论上证明这些算法收敛到次优解,而该次优性取决于这 nn 个环境的异构程度。此外,我们提出一种通过将 nn 个环境嵌入 nn 个向量来实现个性化的启发式方法。该个性化启发式不仅改善了训练,也允许对新环境更好的泛化。

关键词

引用

@article{arxiv.2204.02634,
  title  = {Federated Reinforcement Learning with Environment Heterogeneity},
  author = {Hao Jin and Yang Peng and Wenhao Yang and Shusen Wang and Zhihua Zhang},
  journal= {arXiv preprint arXiv:2204.02634},
  year   = {2022}
}

备注

Artificial Intelligence and Statistics 2022