中文

用于竞争式自课程学习中涌现行为学习的 Stackelberg 博弈

人工智能 2023-05-09 v1 计算机科学与博弈论 多智能体系统 机器人学

摘要

自课程训练是多智能体强化学习(MARL)的一个重要子领域,它允许多个智能体在无监督的共同进化方案中学习涌现技能。机器人学界已在具有物理基础的问题上试验了自课程训练,例如鲁棒控制和交互式操纵任务。然而,这些任务的不对称性使得复杂策略的生成具有挑战性。事实上,环境中的不对称性可能隐式或显式地为部分智能体提供优势,进而可能导致低质量均衡。本文提出一种新颖的博弈论算法——Stackelberg 多智能体深度确定性策略梯度(ST-MADDPG),该算法将双人 MARL 问题表述为具有层级交互结构的 Stackelberg 博弈,其中一方为“领导者”,另一方为“跟随者”,领导者具有优势。我们首先证明,ST-MADDPG 中领导者的优势可用于缓解环境中固有的不对称性。通过利用领导者的优势,ST-MADDPG 改善了共同进化过程的质量,并产生了更复杂精巧的策略,即使面对未见过的强对手也能良好运作。

关键词

引用

@article{arxiv.2305.03735,
  title  = {Stackelberg Games for Learning Emergent Behaviors During Competitive Autocurricula},
  author = {Boling Yang and Liyuan Zheng and Lillian J. Ratliff and Byron Boots and Joshua R. Smith},
  journal= {arXiv preprint arXiv:2305.03735},
  year   = {2023}
}