中文

部分可观测下的多智能体强化学习

机器学习 2021-06-21 v1 人工智能 多智能体系统

摘要

近期对多智能体强化学习(MARL)重新兴起的兴趣已产生一系列令人印象深刻的技術,这些技术利用深度强化学习(主要是 actor-critic 架构),并可应用于可观测性与通信方面有限范围的设置。然而,这类工作的一个持续局限是基于联合动作的表示所带来的维度灾难,其随智能体数量呈指数增长。本文中,我们明确聚焦于这一可扩展性挑战。我们将动作匿名性(其导致联合动作的置换不变性)这一关键洞见应用于两种近期提出的深度 MARL 算法 MADDPG 和 IA2C,并将这些实例化与另一种利用动作匿名性的近期技术即平均场 MARL 进行比较。我们表明,使用近期引入的实用领域,我们的实例化能在比平均场方法更广的一类智能体网络中学习到最优行为。

关键词

引用

@article{arxiv.2106.09825,
  title  = {Many Agent Reinforcement Learning Under Partial Observability},
  author = {Keyang He and Prashant Doshi and Bikramjit Banerjee},
  journal= {arXiv preprint arXiv:2106.09825},
  year   = {2021}
}