拜占庭容错去中心化多臂老虎机
机器学习
2025-06-12 v2 系统与控制
系统与控制
摘要
在去中心化协作多臂老虎机(MAB)中,每个智能体观测到不同的奖励流,并寻求与他人交换信息以选择一系列臂,从而最小化其遗憾值。协作设定下的智能体可以优于独立运行如 Upper-Confidence Bound(UCB)等 MAB 方法的单个智能体。在本文中,我们研究当未知比例的智能体可能为拜占庭式(即,以奖励均值估计或置信集的形式传递任意错误的信息)时,如何恢复此类显著行为。该框架可用于建模计算机网络中的攻击者、向推荐系统注入攻击性内容的煽动者,或金融市场的操纵者。我们的关键贡献是开发了一种完全去中心化的容错上置信界(UCB)算法,该算法将智能体间的信息混合步骤与对不一致及极端值的截断相融合。这一截断步骤使我们能够确立:每个正常智能体的性能在遗憾值方面不差于经典单智能体 UCB1 算法,更重要的是,只要每个智能体至少有 3f+1 个邻居(其中 f 为每个智能体邻域内可能的最大拜占庭智能体数),所有正常智能体的累积遗憾值严格优于非协作情形。我们进一步建立了关于可达遗憾值的时间变化邻居图扩展和极小极大下界。实验证实了该框架在实践中的优点。
引用
@article{arxiv.2310.07320,
title = {Byzantine-Resilient Decentralized Multi-Armed Bandits},
author = {Jingxuan Zhu and Alec Koppel and Alvaro Velasquez and Ji Liu},
journal= {arXiv preprint arXiv:2310.07320},
year = {2025}
}
备注
add a disclaimer