中文

基于多智能体深度强化学习的对抗序贯团队博弈中的协调

人工智能 2019-12-18 v1 神经与进化计算

摘要

许多现实应用涉及智能体团队需协调其行动以对抗潜在对手达成共同目标。本文关注零和博弈中一队玩家面对一名对手的情形,例如桥牌、扑克中的共谋以及投标中的共谋。团队成员在博弈前可通信(即事前协调其策略)的可能性,使得行为策略的使用不尽如人意。我们引入软团队 Actor-Critic(STAC)作为团队协调问题的解决方案,其不需要任何先验领域知识。STAC 允许团队成员通过团队内共享的外生信号有效利用事前通信。STAC 在完全可观测与部分可观测博弈中均达到近最优协调策略,而此前的深度强化学习算法未能达到最优协调行为。

关键词

引用

@article{arxiv.1912.07712,
  title  = {Coordination in Adversarial Sequential Team Games via Multi-Agent Deep Reinforcement Learning},
  author = {Andrea Celli and Marco Ciccone and Raffaele Bongo and Nicola Gatti},
  journal= {arXiv preprint arXiv:1912.07712},
  year   = {2019}
}

备注

Preliminary version