中文

3DPG:面向网络化多智能体系统的分布式深度确定性策略梯度算法

机器学习 2022-11-03 v2 人工智能 多智能体系统

摘要

我们提出分布式深度确定性策略梯度(3DPG),一种用于马尔可夫博弈的多智能体 actor-critic(MAAC)算法。与以往的 MAAC 算法不同,3DPG 在训练与部署阶段均为完全分布式。3DPG 智能体基于最新可用的局部数据(状态、动作)及其他智能体的局部策略计算局部策略梯度。训练期间,这些信息通过可能存在丢包与延迟的通信网络进行交换。因此,网络为数据与策略引入了信息年龄(AoI)。我们证明了即便在信息年龄(AoI)可能无界的情况下,3DPG 的渐近收敛性。这向着实用的在线分布式多智能体学习迈出了重要一步,因为 3DPG 不要求信息确定性可用。我们在温和的实际假设下分析了存在策略与数据传输时的 3DPG。分析表明,3DPG 智能体收敛至马尔可夫博弈的局部纳什均衡,其效用函数表示为智能体局部近似动作值函数(Q 函数)期望。局部 Q 函数的期望是关于由智能体累积局部经验塑造的全局状态-动作空间上极限分布的期望。我们的结果也阐明了一般 MAAC 算法所得策略。我们通过启发性论证与数值实验表明,3DPG 相比训练中使用旧动作而非旧策略的先前 MAAC 算法改善了收敛性。此外,我们展示了 3DPG 对 AoI 具有鲁棒性;即便在较大 AoI 与低数据可用性下也能学习到具竞争力的策略。

关键词

引用

@article{arxiv.2201.00570,
  title  = {3DPG: Distributed Deep Deterministic Policy Gradient Algorithms for Networked Multi-Agent Systems},
  author = {Adrian Redder and Arunselvan Ramaswamy and Holger Karl},
  journal= {arXiv preprint arXiv:2201.00570},
  year   = {2022}
}