中文

一种低后悔值公平多智能体多臂老虎机的有效算法

机器学习 2022-09-27 v1 数据结构与算法

摘要

近来,经典多臂老虎机的多智能体变体被提出以处理在线学习中的公平性问题。受社会选择与经济学中一系列研究的启发,其目标是优化纳什社会福利而非总效用。遗憾的是,此前的算法要么效率不高,要么在轮数 TT 方面达到次优的后悔值。我们提出了一种比此前即便低效的算法也具有更低后悔值的新高效算法。对于 NN 个智能体、KK 个臂和 TT 轮,我们的方法具有 O~(NKT+NK)\tilde{O}(\sqrt{NKT} + NK) 的后悔界。这改进了此前具有 O~(min(NK,NK3/2)T)\tilde{O}( \min(NK, \sqrt{N} K^{3/2})\sqrt{T}) 后悔界的方法。我们还以具有 O~(KT+N2K)\tilde{O}(\sqrt{KT} + N^2K) 后悔值的低效方法补充了我们的高效算法。实验结果证实了我们的高效算法相较于此前方法的有效性。

关键词

引用

@article{arxiv.2209.11817,
  title  = {An Efficient Algorithm for Fair Multi-Agent Multi-Armed Bandit with Low Regret},
  author = {Matthew Jones and Huy Lê Nguyen and Thy Nguyen},
  journal= {arXiv preprint arXiv:2209.11817},
  year   = {2022}
}