中文

联邦离线强化学习:协作式单策略覆盖即足够

机器学习 2024-02-09 v1 多智能体系统 机器学习

摘要

离线强化学习(RL)旨在利用离线数据学习最优策略,由于其在在线数据收集不可行或昂贵的临界应用中的潜力,已引起广泛关注。本工作探讨了联邦学习在离线RL中的优势,旨在协同利用多个智能体上的离线数据集。聚焦于有限时域情景表格马尔可夫决策过程(MDP),我们设计了FedLCB-Q,一种为联邦离线RL量身定制的流行无模型Q学习算法的变体。FedLCB-Q在智能体处使用新颖的学习率调度更新局部Q函数,并在中央服务器上使用重要性平均和精心设计的悲观惩罚项对其进行聚合。我们的样本复杂度分析表明,在适当选择参数和同步调度的情况下,只要局部数据集共同覆盖了最优策略访问的状态-动作空间,FedLCB-Q在智能体数量上实现线性加速,而无需单个智能体具备高质量数据集,这凸显了联邦设置中协作的力量。事实上,其样本复杂度几乎与单智能体对应物相匹配,就如同所有数据都存储在中央位置一样,差异仅在于时域长度的多项式因子。此外,FedLCB-Q具有通信高效性,其通信轮数相对于时域长度仅是对数因子意义上的线性。

关键词

引用

@article{arxiv.2402.05876,
  title  = {Federated Offline Reinforcement Learning: Collaborative Single-Policy Coverage Suffices},
  author = {Jiin Woo and Laixi Shi and Gauri Joshi and Yuejie Chi},
  journal= {arXiv preprint arXiv:2402.05876},
  year   = {2024}
}