中文

异构多主体多臂_bandit:缩小差距与问题推广

机器学习 2021-11-02 v2 信息论 机器学习 math.IT

摘要

尽管近年来对去中心化多主体多臂_bandit(MP-MAB)问题有显著兴趣和诸多进展,异构 MP-MAB 设定下到自然集中式下界之间的遗憾差距仍属开放问题。在本文中,我们提出 BEACON——带自适应通信的批处理探索(Batched Exploration with Adaptive COmmunicatioN)——以弥合该差距。BEACON 通过隐式通信和高效探索方面的新颖贡献实现此目标。对于前者,我们提出一种新颖的自适应差分通信(ADC)设计,显著提升了隐式通信效率。对于后者,精心设计了批处理探索方案以纳入组合上置信界(CUCB)原理。随后我们将现有的线性收益 MP-MAB 问题(系统收益恒为个体收集收益之和)推广至一个新的 MP-MAB 问题,其中系统收益为个体收益的一般(非线性)函数。我们将 BEACON 扩展以求解该问题并证明了对数级遗憾。BEACON 桥接了组合 MAB(CMAB)与 MP-MAB 的算法设计和遗憾分析——MAB 中两个大体脱节的方向,本文结果表明这一此前被忽视的联系值得进一步研究。

关键词

引用

@article{arxiv.2110.14622,
  title  = {Heterogeneous Multi-player Multi-armed Bandits: Closing the Gap and Generalization},
  author = {Chengshuai Shi and Wei Xiong and Cong Shen and Jing Yang},
  journal= {arXiv preprint arXiv:2110.14622},
  year   = {2021}
}

备注

Accepted to NeurIPS 2021, camera-ready version