面向协作多智能体强化学习的隐式信用分配学习
机器学习
2020-10-23 v2 多智能体系统
机器学习
摘要
我们提出一种多智能体 actor-critic 方法,旨在隐式解决完全协作设定下的信用分配问题。我们的核心动机在于,只要满足以下两点,智能体间的信用分配或许无需显式建模:(1)由集中式 critic 导出的策略梯度携带充足信息,使分散式智能体通过最优协作最大化其联合动作价值;(2)整个训练过程中维持一定程度的探索。在集中训练分散执行(CTDE)范式下,我们通过将集中式 critic 构建为超网络来实现前者,使得潜状态表示经由其与随机策略的乘法关联被整合进策略梯度;为实现后者,我们推导了一种称为自适应熵正则化的简单技术,其根据当前策略随机性动态重缩放熵梯度的幅度,以鼓励一致的探索水平。我们的算法称为 LICA,在包括多智能体粒子环境与一组颇具挑战的 StarCraft II 微操任务在内的若干基准上进行了评估,结果表明 LICA 显著优于先前的方法。
引用
@article{arxiv.2007.02529,
title = {Learning Implicit Credit Assignment for Cooperative Multi-Agent Reinforcement Learning},
author = {Meng Zhou and Ziyu Liu and Pengwei Sui and Yixuan Li and Yuk Ying Chung},
journal= {arXiv preprint arXiv:2007.02529},
year = {2020}
}
备注
NeurIPS 2020 Camera Ready; first two authors contributed equally