中文

对对抗性腐败鲁棒的多智能体随机赌博机

机器学习 2024-11-14 v1 机器学习

摘要

我们研究了异构环境下存在对抗性腐败的多智能体多臂赌博机问题,其中每个智能体只能访问一部分臂。对手可以腐败所有智能体的奖励观测值。智能体之间共享这些被腐败的奖励,目标是最大化所有智能体的累积总奖励(并且不被对手误导)。我们提出了一种对对抗性腐败鲁棒的多智能体协作学习算法。对于这种新设计的算法,我们证明,具有未知腐败预算CC的对手仅会在标准非腐败设置下的模型遗憾值上增加一个附加项O((L/Lmin)C)O((L / L_{\min}) C),其中LL是智能体总数,LminL_{\min}是共同访问某个臂的最小智能体数量。作为副产品,我们的算法在简化为单智能体和同质多智能体场景时,也分别改进了最先进的遗憾界,收紧了乘性因子KK(臂的数量)和LL(智能体的数量)。

关键词

引用

@article{arxiv.2411.08167,
  title  = {Multi-Agent Stochastic Bandits Robust to Adversarial Corruptions},
  author = {Fatemeh Ghaffari and Xuchuang Wang and Jinhang Zuo and Mohammad Hajiesmaili},
  journal= {arXiv preprint arXiv:2411.08167},
  year   = {2024}
}