中文

面向协作多智能体上下文_bandit 的核方法

机器学习 2020-08-17 v1 多智能体系统 机器学习

摘要

协作多智能体决策涉及一组智能体在具有延迟的网络上通信并协作解决学习问题。本文考虑核化上下文_bandit 问题,其中智能体获得的奖励是相关再生核希尔伯特空间(RKHS)中上下文映像的任意线性函数,且一组智能体必须协作以共同解决各自独特的决策问题。针对该问题,我们提出 \textsc{Coop-KernelUCB} 算法,该算法在每智能体后悔上提供近最优界,且在计算与通信上均高效。针对协作问题的特例,我们还提供了 \textsc{Coop-KernelUCB} 的变体,可实现最优的每智能体后悔。此外,我们的算法推广了多智能体_bandit 设定中的若干已有结果。最后,在一系列合成与真实世界多智能体网络基准上,我们证明了所提算法显著优于现有基准。

关键词

引用

@article{arxiv.2008.06220,
  title  = {Kernel Methods for Cooperative Multi-Agent Contextual Bandits},
  author = {Abhimanyu Dubey and Alex Pentland},
  journal= {arXiv preprint arXiv:2008.06220},
  year   = {2020}
}

备注

19 pages including supplement, camera-ready at ICML 2020