面向拜占庭攻击下的去中心化多智能体策略评估的硬度分析
密码学与安全
2024-09-24 v2 分布式、并行与集群计算
机器学习
摘要
本文研究了在存在最多 个故障代理人的情况下,面向完全去中心化的多智能体策略评估问题,这是合作多智能体强化学习中一个重要子问题。我们特别关注具有模型投毒设置的拜占庭故障模型。在一般情况下,策略评估是指对给定策略的值函数进行评估。在合作多智能体系统中,系统范围的奖励通常建模为来自所有代理人的奖励的均值。我们在拜占庭代理人的存在下,尤其是在异构本地奖励的设置下,研究多智能体策略评估问题。理想情况下,代理人的目标是评估给定策略下的累积系统范围奖励,这是正常代理人奖励的均值。这意味着所有代理人对共同值(一致性部分)达成一致,并且进一步地,一致值是值函数(收敛性部分)。然而,我们证明了这一目标无法实现。相反,我们考虑问题的一个松化版本,其中代理人的目标是评估累积系统范围奖励,这是正常代理人奖励的合适加权平均值。我们进一步证明,没有正确的算法能保证正权重的总数超过 ,其中 是正常代理人的数量。为了此目的,我们提出了一个能够在标量函数逼近下保证渐近一致性的抗拜占庭去中心化时序差算法。我们随后对所提出算法的有效性进行了实证测试。
引用
@article{arxiv.2409.12882,
title = {On the Hardness of Decentralized Multi-Agent Policy Evaluation under Byzantine Attacks},
author = {Hairi and Minghong Fang and Zifan Zhang and Alvaro Velasquez and Jia Liu},
journal= {arXiv preprint arXiv:2409.12882},
year = {2024}
}
备注
To appear in Proceedings of the 22nd International Symposium on Modeling and Optimization in Mobile, Ad hoc, and Wireless Networks (WiOpt 2024)