无向图上鲁棒的多智能体Bandit问题
机器学习
2023-01-30 v2 多智能体系统
机器学习
摘要
我们考虑一种多智能体多臂bandit设置,其中个诚实智能体通过网络协作以最小化后悔值,但个恶意智能体可任意破坏学习。假设网络为完全图,现有算法在此设置下产生的后悔值,其中为臂数,为臂间隙。对于,这优于单智能体基线后悔值。本工作中,我们表明超越完全图情形时情况更为复杂。特别地,我们证明若在无向线图上使用最先进算法,诚实智能体在时间达到关于和的双指数之前会遭受(近乎)线性后悔。鉴于此负面结果,我们提出一种新算法,使得第个智能体在任何连通无向图上的后悔值为,其中为的恶意邻居数。因此,我们将现有后悔界推广至完全图之外(此时),并表明恶意智能体的影响完全是局部的(即仅与直接相连的个恶意智能体影响其长期后悔)。
引用
@article{arxiv.2203.00076,
title = {Robust Multi-Agent Bandits Over Undirected Graphs},
author = {Daniel Vial and Sanjay Shakkottai and R. Srikant},
journal= {arXiv preprint arXiv:2203.00076},
year = {2023}
}