面向动态团队组成的教练-玩家多智能体强化学习
人工智能
2021-09-07 v3
摘要
在现实世界的多智能体系统中,具有不同能力的智能体可能加入或离开而不改变团队的总体目标。协调此类动态组成的团队具有挑战性:最优团队策略随组成而变化。我们提出 COPA,一种教练-玩家框架以解决该问题。我们假设教练具有环境的全局视野,并通过分发个体策略来协调仅有局部视野的玩家。具体而言,我们 1) 对教练与玩家均采用注意力机制;2) 提出变分目标以正则化学习;以及 3) 设计自适应通信方法让教练决定何时与玩家通信。我们在资源收集任务、救援游戏与星际争霸微管理任务上验证了我们的方法。我们展示了对新团队组成的零样本泛化能力。我们的方法取得了与所有玩家具有环境全视野设定相当或更好的性能。此外,我们观察到即便教练使用自适应通信策略仅 13% 的时间通信,性能仍保持高位。
引用
@article{arxiv.2105.08692,
title = {Coach-Player Multi-Agent Reinforcement Learning for Dynamic Team Composition},
author = {Bo Liu and Qiang Liu and Peter Stone and Animesh Garg and Yuke Zhu and Animashree Anandkumar},
journal= {arXiv preprint arXiv:2105.08692},
year = {2021}
}
备注
International Conference on Machine Learning