中文

多智能体强化学习中基于状态的评论家的深入理解

机器学习 2022-05-26 v2 人工智能 多智能体系统

摘要

用于分散执行的集中训练(Centralized Training for Decentralized Execution,以集中离线方式完成训练)已成为多智能体强化学习中的流行解决范式。许多此类方法采取带基于状态评论家的 actor-critic 形式,因为集中训练允许访问真实系统状态,这在训练期间虽有用以至于执行时不可用。基于状态的评论家已成为常见的经验选择,尽管其理论与分析依据有限。在本文中,我们表明基于状态的评论家会在策略梯度估计中引入偏差,潜在破坏算法的渐近保证。我们还表明,即使基于状态的评论家不引入任何偏差,它们仍可能导致更大的梯度方差,这与常见直觉相反。最后,我们通过在广泛常见基准上比较不同形式的集中评论家,展示了理论在实践中的效应,并详述各种环境属性与不同类型评论家有效性之间的关系。

关键词

引用

@article{arxiv.2201.01221,
  title  = {A Deeper Understanding of State-Based Critics in Multi-Agent Reinforcement Learning},
  author = {Xueguang Lyu and Andrea Baisero and Yuchen Xiao and Christopher Amato},
  journal= {arXiv preprint arXiv:2201.01221},
  year   = {2022}
}