Federated UCBVI:面向异构智能体的通信高效联邦遗憾最小化
机器学习
2024-10-31 v1 机器学习
摘要
本文提出了联邦上置信界值迭代算法(),这是 算法(Azar et al., 2017)面向联邦学习框架的新型扩展。我们证明 的遗憾以 的速率增长,其中包含一个由于异构性引起的微小附加项, 为状态数, 为动作数, 为回合长度, 为智能体数量, 为回合数。值得注意的是,在单智能体设定下,该上界在多对数因子意义下匹配极小极大下界,而在多智能体场景下, 具有线性加速。为了进行分析,我们引入了一种新的异构性度量,这可能具有独立的理论意义。此外,我们证明,与现有的联邦强化学习方法不同, 的通信复杂度仅随智能体数量边际增长。
引用
@article{arxiv.2410.22908,
title = {Federated UCBVI: Communication-Efficient Federated Regret Minimization with Heterogeneous Agents},
author = {Safwan Labbi and Daniil Tiapkin and Lorenzo Mancini and Paul Mangold and Eric Moulines},
journal= {arXiv preprint arXiv:2410.22908},
year = {2024}
}