一种用于多智能体稀疏奖励强化学习的合作图方法
人工智能
2022-08-08 v1 机器学习
多智能体系统
摘要
多智能体强化学习(MARL)可解决复杂协作任务。然而,现有MARL方法的效率严重依赖定义良好的奖励函数。具有稀疏奖励反馈的多智能体任务尤其具有挑战性,不仅因为信用分配问题,也由于获得正奖励反馈的概率很低。本文中,我们设计了一种称为合作图(CG)的图网络。合作图是两个简单二分图的结合,即智能体聚类子图(ACG)和簇指定子图(CDG)。接下来,基于这一新颖图结构,我们提出合作图多智能体强化学习(CG-MARL)算法,能高效处理多智能体任务中的稀疏奖励问题。在CG-MARL中,智能体由合作图直接控制。并训练策略神经网络来操控该合作图,以隐式方式引导智能体实现协作。CG-MARL的这种分层特性为定制簇动作提供了空间,即一个用于引入基础协作知识的可扩展接口。实验中,CG-MARL在稀疏奖励多智能体基准(包括反入侵拦截任务和多货物配送任务)上展现了SOTA性能。
引用
@article{arxiv.2208.03002,
title = {A Cooperation Graph Approach for Multiagent Sparse Reward Reinforcement Learning},
author = {Qingxu Fu and Tenghai Qiu and Zhiqiang Pu and Jianqiang Yi and Wanmai Yuan},
journal= {arXiv preprint arXiv:2208.03002},
year = {2022}
}