鲁棒多智能体多臂老虎机
机器学习
2022-03-02 v3 分布式、并行与集群计算
社会与信息网络
机器学习
摘要
近期工作表明,面对独立随机 -臂老虎机实例的智能体可通过协作降低后悔值。然而,这些工作假设每个智能体总是将其各自的最优臂估计推荐给其他智能体,这在预期应用中(分布式计算中的机器故障或社交推荐系统中的垃圾信息)是不现实的。因此,我们将该设定推广为包含 个诚实智能体和 个恶意智能体,前者推荐最优臂估计,后者推荐任意臂。我们首先证明,即使只有一个恶意智能体,现有的基于协作的算法也无法在后悔保证上优于单智能体基线。我们提出一种方案,使诚实智能体学习哪些智能体是恶意的,并动态减少与它们(即“屏蔽”)的通信。我们证明,在 相对于 较小但对恶意智能体行为不做假设的条件下,协作确实降低了该算法的后悔值,从而确保我们的算法对任意恶意推荐策略均具有鲁棒性。
引用
@article{arxiv.2007.03812,
title = {Robust Multi-Agent Multi-Armed Bandits},
author = {Daniel Vial and Sanjay Shakkottai and R. Srikant},
journal= {arXiv preprint arXiv:2007.03812},
year = {2022}
}