基于好奇心驱动探索的 episodic 多智能体强化学习
机器学习
2021-11-23 v1 人工智能
摘要
在深度协作多智能体强化学习(MARL)中,复杂协调问题下的高效探索仍具挑战性。本文提出一种新颖的基于好奇心驱动探索的 episodic 多智能体强化学习,称为EMC。我们借助流行的因子化MARL算法的一个洞见:即“诱导的”个体Q值(用于局部执行的个体效用函数)是局部动作-观测历史的嵌入,并且由于集中训练期间的奖励反向传播,可以捕捉智能体间的交互。因此,我们使用个体Q值的预测误差作为内在奖励以进行协调探索,并利用 episodic 记忆来利用已探索的信息丰富经验以加速策略训练。由于智能体个体Q值函数的动态捕捉了状态的新颖性以及其他智能体的影响,我们的内在奖励能够引导向新的或有前景的状态进行协调探索。我们通过教学示例阐明了方法的优势,并在StarCraft II微操基准的挑战性任务上展示了其相对于最先进MARL基线的显著优越性。
引用
@article{arxiv.2111.11032,
title = {Episodic Multi-agent Reinforcement Learning with Curiosity-Driven Exploration},
author = {Lulu Zheng and Jiarui Chen and Jianhao Wang and Jiamin He and Yujing Hu and Yingfeng Chen and Changjie Fan and Yang Gao and Chongjie Zhang},
journal= {arXiv preprint arXiv:2111.11032},
year = {2021}
}