中文

一种对抗者感知的分散网络化多智能体强化学习算法

机器学习 2023-06-19 v2 多智能体系统

摘要

分散式多智能体强化学习(MARL)算法在文献中已变得流行,因为它允许异构智能体拥有各自的奖励函数,而典型的多智能体马尔可夫决策过程(MDP)设定假设所有智能体共享奖励函数。在本工作中,我们沿用现有的协作式 MARL 研究,其中连通时变网络中的智能体可相互交换信息以达成共识。我们揭示了现有 MARL 算法在共识更新中的漏洞,即智能体可能偏离其常规共识更新,我们称之为对抗性智能体。随后,我们提出一种算法,使非对抗性智能体在受限设定下于对抗者存在时仍能达成共识。

关键词

引用

@article{arxiv.2305.05573,
  title  = {An Algorithm For Adversary Aware Decentralized Networked MARL},
  author = {Soumajyoti Sarkar},
  journal= {arXiv preprint arXiv:2305.05573},
  year   = {2023}
}