联邦Q学习的异构性之福:线性加速及其超越
机器学习
2023-12-14 v2 机器学习
摘要
当强化学习(RL)所用数据由多个智能体以分布式方式收集时,RL算法的联邦版本允许协作学习,而无需智能体共享其本地数据。在本文中,我们考虑联邦Q学习,其目标是通过周期性聚合仅在本地数据上训练的本地Q估计来学习最优Q函数。聚焦于无限 horizon 表格型马尔可夫决策过程,我们给出了联邦Q学习的同步与异步变体的样本复杂度保证。在这两种情况下,我们的界都展现出相对于智能体数量的线性加速,以及对其他显著问题参数的近最优依赖。在异步设定下,现有联邦Q学习的分析采用本地Q估计的等权平均,要求每个智能体覆盖整个状态-动作空间。相比之下,我们改进的样本复杂度与所有智能体的平均平稳状态-动作占用分布的最小项成反比,从而仅要求智能体集体覆盖整个状态-动作空间,揭示了异构性通过放宽单智能体情形的覆盖要求而赋能协作学习的福祉。然而,当本地轨迹高度异构时,其样本复杂度仍然受损。为此,我们提出一种带重要性平均的新型联邦Q学习算法,对更频繁访问的状态-动作对赋予更大权重,从而实现了鲁棒的线性加速,如同所有轨迹被集中处理一般,而不论本地行为策略的异构性如何。
引用
@article{arxiv.2305.10697,
title = {The Blessing of Heterogeneity in Federated Q-Learning: Linear Speedup and Beyond},
author = {Jiin Woo and Gauri Joshi and Yuejie Chi},
journal= {arXiv preprint arXiv:2305.10697},
year = {2023}
}
备注
Short version at ICML 2023