中文

散度正则化多智能体 Actor-Critic

机器学习 2022-06-22 v2 人工智能 多智能体系统

摘要

熵正则化是强化学习(RL)中一种流行的方法。尽管它有诸多优点,却改变了原始马尔可夫决策过程(MDP)的 RL 目标。虽有散度正则化被提出以解决此问题,但它无法轻易应用于协作多智能体强化学习(MARL)。本文研究协作 MARL 中的散度正则化,并提出一种新颖的离策略协作 MARL 框架——散度正则化多智能体 actor-critic(DMAC)。理论上,我们推导出 DMAC 的更新规则,其天然离策略,并保障在原始 MDP 与散度正则化 MDP 中均单调策略改进与收敛。我们还给出了收敛策略与原始 MDP 中最优策略之间差异的界。DMAC 是一个灵活框架,可与许多现有 MARL 算法结合。在实验上,我们在一个教学用随机博弈与 StarCraft Multi-Agent Challenge 中评估 DMAC,表明 DMAC 大幅提升了现有 MARL 算法的性能。

关键词

引用

@article{arxiv.2110.00304,
  title  = {Divergence-Regularized Multi-Agent Actor-Critic},
  author = {Kefan Su and Zongqing Lu},
  journal= {arXiv preprint arXiv:2110.00304},
  year   = {2022}
}

备注

ICML 2022, 24 pages, 10 figures