对对抗性腐败鲁棒的多智能体随机赌博机
机器学习
2024-11-14 v1 机器学习
摘要
我们研究了异构环境下存在对抗性腐败的多智能体多臂赌博机问题,其中每个智能体只能访问一部分臂。对手可以腐败所有智能体的奖励观测值。智能体之间共享这些被腐败的奖励,目标是最大化所有智能体的累积总奖励(并且不被对手误导)。我们提出了一种对对抗性腐败鲁棒的多智能体协作学习算法。对于这种新设计的算法,我们证明,具有未知腐败预算的对手仅会在标准非腐败设置下的模型遗憾值上增加一个附加项,其中是智能体总数,是共同访问某个臂的最小智能体数量。作为副产品,我们的算法在简化为单智能体和同质多智能体场景时,也分别改进了最先进的遗憾界,收紧了乘性因子(臂的数量)和(智能体的数量)。
引用
@article{arxiv.2411.08167,
title = {Multi-Agent Stochastic Bandits Robust to Adversarial Corruptions},
author = {Fatemeh Ghaffari and Xuchuang Wang and Jinhang Zuo and Mohammad Hajiesmaili},
journal= {arXiv preprint arXiv:2411.08167},
year = {2024}
}