多智能体强化学习中的集中式评论家
人工智能
2024-08-28 v1
摘要
集中式训练与分散式执行(Centralized Training for Decentralized Execution)指的是在集中化方式进行离线训练的智能体,其在在线执行时采用分散方式,这一方法在多智能体强化学习(MARL)中变得越来越流行。特别是 developing actor-critic 方法训练分散式 actor,同时使用集中式评论家,该集中式评论家可获取整个系统的全局信息,包括真实系统状态。这种集中式评论家是可能的,因为它依赖于离线信息,而不用于在线执行。尽管这些方法在多个领域中表现良好,已成为 MARL 的事实标准,但在此背景下使用集中式评论家仍未得到充分的理论或实证分析。因此,本文对集中式和分散式评论家方法进行形式化分析,分析在部分可观测环境中使用基于状态的评论家的影响。我们推导了与常见直觉相反的理论:评论家集中化并非严格有益,使用基于状态的值反而可能有害。我们进一步证明,基于状态的评论家可能比基于历史的评论家引入意外的偏差和方差。最后,我们通过在广泛的常见多智能体基准测试上比较不同形式的评论家来展示理论在实践中的应用。实验显示实践问题,例如在部分可观测性下进行表示学习的困难,这突显了为何在文献中常常忽视这些理论问题。
引用
@article{arxiv.2408.14597,
title = {On Centralized Critics in Multi-Agent Reinforcement Learning},
author = {Xueguang Lyu and Andrea Baisero and Yuchen Xiao and Brett Daley and Christopher Amato},
journal= {arXiv preprint arXiv:2408.14597},
year = {2024}
}