中文

用于开放多智能体系统强化学习改进的隐变量交互式 A2C

机器学习 2023-05-10 v1 人工智能 多智能体系统

摘要

集中式训练的多智能体强化学习(MARL)方法十分普遍。但这些方法需从其他智能体获取各类信息,在竞争或对抗环境中可能不可行。近期方法交互式优势 actor-critic(IA2C)采用分散训练与分散执行,旨在从可能含噪的观测中预测其他智能体的动作。本文中,我们提出隐变量 IA2C,利用编码器-解码器架构学习隐藏状态与其他智能体动作的隐表示。我们在两个由大量智能体构成的领域中的实验表明,隐变量 IA2C 通过降低方差与更快收敛显著提升了样本效率。此外,我们引入了这些领域的开放版本,其中智能体数量可随时间变化,并在这些实例上进行了评估。

关键词

引用

@article{arxiv.2305.05159,
  title  = {Latent Interactive A2C for Improved RL in Open Many-Agent Systems},
  author = {Keyang He and Prashant Doshi and Bikramjit Banerjee},
  journal= {arXiv preprint arXiv:2305.05159},
  year   = {2023}
}