联邦 Q-Learning 中的样本与通信复杂度权衡
机器学习
2024-10-31 v2 最优化与控制
机器学习
摘要
我们考虑了联邦 Q-Learning 问题,其中 个智能体旨在协同学习一个具有有限状态和动作空间的未知无限时域 Markov 决策过程的最优 Q 函数。我们研究了广泛使用的间歇通信算法类别在样本与通信复杂度之间的权衡。我们首先建立了逆定理,结果表明,在单智能体样本复杂度方面提供相对于智能体数量任意加速的联邦 Q-Learning 算法,需要产生至少 量级(至多相差对数因子)的通信成本,其中 是折扣因子。我们还提出了一种名为 Fed-DVR-Q 的新算法,这是首个同时实现阶数最优样本和通信复杂度的联邦 Q-Learning 算法。因此,这些结果共同提供了联邦 Q-Learning 中样本与通信复杂度权衡的完整刻画。
引用
@article{arxiv.2408.16981,
title = {The Sample-Communication Complexity Trade-off in Federated Q-Learning},
author = {Sudeep Salgia and Yuejie Chi},
journal= {arXiv preprint arXiv:2408.16981},
year = {2024}
}
备注
Accepted to NeurIPS 2024