中文

去中心化策略优化

机器学习 2022-11-08 v1

摘要

在合作多智能体强化学习中,去中心化学习或独立学习的研究已有数十年的历史。最近的实证研究表明,独立 PPO(IPPO)在多个基准测试中能够取得良好性能,接近甚至优于中心化训练去中心化执行的方法。然而,具有收敛保证的去中心化 actor-critic 仍是开放问题。本文提出去中心化策略优化(DPO),一种具有单调改进和收敛保证的去中心化 actor-critic 算法。我们推导了一种新颖的去中心化代理目标用于策略优化,使得联合策略的单调改进可由每个智能体独立优化该代理目标来保证。在实践中,该去中心化代理目标可通过每个智能体上用于策略优化的两个自适应系数实现。我们在多种合作多智能体任务中将 DPO 与 IPPO 进行比较,涵盖离散与连续动作空间,以及完全与部分可观测环境。结果表明 DPO 在大多数任务中优于 IPPO,这可作为我们理论结果的佐证。

关键词

引用

@article{arxiv.2211.03032,
  title  = {Decentralized Policy Optimization},
  author = {Kefan Su and Zongqing Lu},
  journal= {arXiv preprint arXiv:2211.03032},
  year   = {2022}
}

备注

14 pages