中文

稀疏超图上多智能体汤普森采样的有限时间频率派遗憾界

机器学习 2023-12-27 v1 多智能体系统 统计理论 机器学习 统计理论

摘要

我们研究多智能体多臂老虎机(MAMAB)问题,其中mm个智能体被分解为ρ\rho个重叠的组。每个组代表一条超边,形成智能体上的超图。在每个交互轮次中,学习器拉一个联合臂(由每个智能体的个体臂组成),并根据超图结构获得奖励。具体来说,我们假设每条超边有一个局部奖励,联合臂的奖励是这些局部奖励的总和。先前的工作引入了多智能体汤普森采样(MATS)算法\citep{verstraeten2020multiagent}并推导了贝叶斯遗憾界。然而,如何推导汤普森采样在此多智能体设置下的频率派遗憾界仍然是一个开放问题。为了解决这些问题,我们提出了一种高效的MATS变体,即ϵ\epsilon-探索多智能体汤普森采样(ϵ\epsilon-MATS)算法,它以概率ϵ\epsilon执行MATS探索,否则采用贪婪策略。我们证明ϵ\epsilon-MATS在时间跨度和局部臂大小上实现了最坏情况下的频率派遗憾界,该界是次线性的。我们还推导了该设置的下界,这表明当超图足够稀疏时,我们的频率派遗憾上界在常数和对数项上是最优的。在标准MAMAB问题上的充分实验表明,与相同设置下的现有算法相比,ϵ\epsilon-MATS具有优越的性能和改进的计算效率。

关键词

引用

@article{arxiv.2312.15549,
  title  = {Finite-Time Frequentist Regret Bounds of Multi-Agent Thompson Sampling on Sparse Hypergraphs},
  author = {Tianyuan Jin and Hao-Lun Hsu and William Chang and Pan Xu},
  journal= {arXiv preprint arXiv:2312.15549},
  year   = {2023}
}

备注

22 pages, 7 figures, 2 tables. To appear in the proceedings of the 38th Annual AAAI Conference on Artificial Intelligence (AAAI'2024)