中文

联邦 Q-Learning:以低通信代价实现线性遗憾加速

机器学习 2024-05-09 v2 机器学习

摘要

本文研究表格型情景式马尔可夫决策过程(MDP)的联邦强化学习,其中在中央服务器的协调下,多个智能体协同探索环境并学习最优策略,而无需共享其原始数据。在类似设定下,诸如收敛速率和样本复杂度等指标已实现随智能体数量的线性加速,但能否设计出一种无模型算法以低通信代价实现线性遗憾加速仍不明确。我们提出了两种联邦 Q-Learning 算法,分别称为 FedQ-Hoeffding 和 FedQ-Bernstein,并证明当时间跨度足够大时,其相应的总遗憾相较于单智能体对应算法实现了线性加速,同时通信代价随总时间步数 TT 呈对数级增长。这些结果依赖于智能体与服务器之间的事件触发同步机制、服务器聚合状态-动作值的局部估计以形成全局估计时的一种新颖步长选择,以及一组用于界定非鞅差之和的新型集中不等式。这是首项表明在联邦强化学习中无模型算法可实现线性遗憾加速与对数级通信代价的工作。

关键词

引用

@article{arxiv.2312.15023,
  title  = {Federated Q-Learning: Linear Regret Speedup with Low Communication Cost},
  author = {Zhong Zheng and Fengyu Gao and Lingzhou Xue and Jing Yang},
  journal= {arXiv preprint arXiv:2312.15023},
  year   = {2024}
}

备注

51 pages