面向多智能体 $QD$-学习的弹性研究
系统与控制
2021-04-08 v1 系统与控制
摘要
本文研究存在拜占庭智能体的网络化(点对点)系统中的多智能体强化学习(MARL)问题。我们基于已有的分布式 -学习算法,并允许网络中某些智能体以任意和对抗的方式行为(如拜占庭攻击模型所刻画)。在所提算法下,若网络拓扑是 -鲁棒的且每个常规智能体的邻域中至多存在 个拜占庭智能体,我们证明了所有常规智能体的价值函数几乎必然收敛到所有常规智能体最优价值函数的邻域。对于每个状态,若所有常规智能体对应于不同动作的最优 -值充分分离,我们的方法允许每个常规智能体学习到所有常规智能体的最优策略。
引用
@article{arxiv.2104.03153,
title = {Towards Resilience for Multi-Agent $QD$-Learning},
author = {Yijing Xie and Shaoshuai Mou and Shreyas Sundaram},
journal= {arXiv preprint arXiv:2104.03153},
year = {2021}
}