中文

Federated UCBVI:面向异构智能体的通信高效联邦遗憾最小化

机器学习 2024-10-31 v1 机器学习

摘要

本文提出了联邦上置信界值迭代算法(Fed-UCBVI\texttt{Fed-UCBVI}),这是 UCBVI\texttt{UCBVI} 算法(Azar et al., 2017)面向联邦学习框架的新型扩展。我们证明 Fed-UCBVI\texttt{Fed-UCBVI} 的遗憾以 O~(H3SAT/M)\tilde{\mathcal{O}}(\sqrt{H^3 |\mathcal{S}| |\mathcal{A}| T / M}) 的速率增长,其中包含一个由于异构性引起的微小附加项,S|\mathcal{S}| 为状态数,A|\mathcal{A}| 为动作数,HH 为回合长度,MM 为智能体数量,TT 为回合数。值得注意的是,在单智能体设定下,该上界在多对数因子意义下匹配极小极大下界,而在多智能体场景下,Fed-UCBVI\texttt{Fed-UCBVI} 具有线性加速。为了进行分析,我们引入了一种新的异构性度量,这可能具有独立的理论意义。此外,我们证明,与现有的联邦强化学习方法不同,Fed-UCBVI\texttt{Fed-UCBVI} 的通信复杂度仅随智能体数量边际增长。

关键词

引用

@article{arxiv.2410.22908,
  title  = {Federated UCBVI: Communication-Efficient Federated Regret Minimization with Heterogeneous Agents},
  author = {Safwan Labbi and Daniil Tiapkin and Lorenzo Mancini and Paul Mangold and Eric Moulines},
  journal= {arXiv preprint arXiv:2410.22908},
  year   = {2024}
}