用于开放多智能体系统强化学习改进的隐变量交互式 A2C
机器学习
2023-05-10 v1 人工智能
多智能体系统
摘要
集中式训练的多智能体强化学习(MARL)方法十分普遍。但这些方法需从其他智能体获取各类信息,在竞争或对抗环境中可能不可行。近期方法交互式优势 actor-critic(IA2C)采用分散训练与分散执行,旨在从可能含噪的观测中预测其他智能体的动作。本文中,我们提出隐变量 IA2C,利用编码器-解码器架构学习隐藏状态与其他智能体动作的隐表示。我们在两个由大量智能体构成的领域中的实验表明,隐变量 IA2C 通过降低方差与更快收敛显著提升了样本效率。此外,我们引入了这些领域的开放版本,其中智能体数量可随时间变化,并在这些实例上进行了评估。
引用
@article{arxiv.2305.05159,
title = {Latent Interactive A2C for Improved RL in Open Many-Agent Systems},
author = {Keyang He and Prashant Doshi and Bikramjit Banerjee},
journal= {arXiv preprint arXiv:2305.05159},
year = {2023}
}