基于技能发现的层次化协作多智能体强化学习
机器学习
2020-05-11 v3 多智能体系统
机器学习
摘要
职业团队运动中的人类选手通过动态选择互补技能并执行基本动作来完成这些技能,从而实现高水平的协调。作为向在完全协作的多智能体环境中创造具备此能力的智能体迈出的一步,我们提出了一种具有无监督技能发现的双层层次化多智能体强化学习(MARL)算法。智能体在底层通过独立 Q-learning 学习有用且各异的技能,而在高层通过带有外在团队奖励的集中式多智能体训练学习选择互补的潜在技能变量。底层技能集合源于一种内在奖励,该奖励仅促进从底层技能的轨迹中解码潜在技能变量,而无需为每个技能手工设计奖励。为实现可扩展的分散式执行,每个智能体基于局部观测独立选择潜在技能变量和基本动作。我们的整体方法使得能够使用通用协作 MARL 算法训练高层策略,并使用单智能体 RL 训练底层技能。在一个随机高维团队游戏上的实验展示了有用技能与协作团队玩法的涌现。所学技能的可解释性表明了所提方法在实现团队运动游戏中的人机协作方面的前景。
引用
@article{arxiv.1912.03558,
title = {Hierarchical Cooperative Multi-Agent Reinforcement Learning with Skill Discovery},
author = {Jiachen Yang and Igor Borovikov and Hongyuan Zha},
journal= {arXiv preprint arXiv:1912.03558},
year = {2020}
}
备注
Published at International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2020)