中文

无向图上鲁棒的多智能体Bandit问题

机器学习 2023-01-30 v2 多智能体系统 机器学习

摘要

我们考虑一种多智能体多臂bandit设置,其中nn个诚实智能体通过网络协作以最小化后悔值,但mm个恶意智能体可任意破坏学习。假设网络为完全图,现有算法在此设置下产生O((m+K/n)log(T)/Δ)O( (m + K/n) \log (T) / \Delta )的后悔值,其中KK为臂数,Δ\Delta为臂间隙。对于mKm \ll K,这优于单智能体基线后悔值O(Klog(T)/Δ)O(K\log(T)/\Delta)。本工作中,我们表明超越完全图情形时情况更为复杂。特别地,我们证明若在无向线图上使用最先进算法,诚实智能体在时间达到关于KKnn的双指数之前会遭受(近乎)线性后悔。鉴于此负面结果,我们提出一种新算法,使得第ii个智能体在任何连通无向图上的后悔值为O((dmal(i)+K/n)log(T)/Δ)O( ( d_{\text{mal}}(i) + K/n) \log(T)/\Delta),其中dmal(i)d_{\text{mal}}(i)ii的恶意邻居数。因此,我们将现有后悔界推广至完全图之外(此时dmal(i)=md_{\text{mal}}(i) = m),并表明恶意智能体的影响完全是局部的(即仅与ii直接相连的dmal(i)d_{\text{mal}}(i)个恶意智能体影响其长期后悔)。

关键词

引用

@article{arxiv.2203.00076,
  title  = {Robust Multi-Agent Bandits Over Undirected Graphs},
  author = {Daniel Vial and Sanjay Shakkottai and R. Srikant},
  journal= {arXiv preprint arXiv:2203.00076},
  year   = {2023}
}