分散式确定性多智能体强化学习
机器学习
2021-02-22 v1
摘要
[Zhang, ICML 2018]给出了首个提供收敛保证的分散式actor-critic多智能体强化学习(MARL)算法。该工作中策略为随机策略且定义于有限动作空间。我们将那些结果扩展,给出一种可证明收敛的分散式actor-critic算法,用于学习连续动作空间上的确定性策略。确定性策略在真实场景中十分重要。为处理确定性策略固有的探索不足,我们考虑离线与在线两种设定。我们给出局部确定性策略梯度的表达式、分散式确定性actor-critic算法,以及针对线性逼近值函数的收敛保证。本工作将有助于在高位动作空间中实现分散式MARL,并为MARL的更广泛应用铺平道路。
引用
@article{arxiv.2102.09745,
title = {Decentralized Deterministic Multi-Agent Reinforcement Learning},
author = {Antoine Grosnit and Desmond Cai and Laura Wynter},
journal= {arXiv preprint arXiv:2102.09745},
year = {2021}
}