基于策略共识的分布式离策略 Actor-Critic 强化学习
机器学习
2019-03-25 v1 人工智能
最优化与控制
机器学习
摘要
本文提出一种分布式离策略 actor critic 方法来解决多智能体强化学习问题。具体而言,我们假设所有智能体保持对全局最优策略参数的局部估计,并独立更新其局部值函数估计。然后,我们引入一个额外的共识步骤,使所有智能体在渐近意义上就全局最优策略函数达成一致。我们给出了所提算法的收敛性分析,并使用一个分布式资源分配实例验证了所提算法的有效性。与相关的分布式 actor critic 方法相比,这里的智能体不共享其局部任务的信息,而是通过协调来估计全局策略函数。
引用
@article{arxiv.1903.09255,
title = {Distributed off-Policy Actor-Critic Reinforcement Learning with Policy Consensus},
author = {Yan Zhang and Michael M. Zavlanos},
journal= {arXiv preprint arXiv:1903.09255},
year = {2019}
}