中文

反事实多智能体策略梯度

人工智能 2024-12-12 v3 多智能体系统

摘要

协作多智能体系统可自然地用于建模许多现实世界问题,如网络数据包路由和自动驾驶车辆的协调。对于能够为此类系统高效学习去中心化策略的新型强化学习方法存在巨大需求。为此,我们提出一种新的多智能体行动者-评论家方法,称为反事实多智能体(COMA)策略梯度。COMA 使用一个中心化评论家来估计 Q 函数,并使用去中心化的行动者来优化智能体的策略。此外,为解决多智能体信用分配的挑战,它使用一个反事实基线,该基线在保持其他智能体动作固定的同时,边缘化掉单个智能体的动作。COMA 还使用一种评论家表示,使得反事实基线能在单次前向传播中高效计算。我们在星际争霸单位微操作的测试平台上评估 COMA,使用具有显著部分可观测性的去中心化变体。在此设置下,COMA 相比其他多智能体行动者-评论家方法显著提升了平均性能,且表现最佳的智能体可与能获取完整状态的最先进中心化控制器相竞争。

关键词

引用

@article{arxiv.1705.08926,
  title  = {Counterfactual Multi-Agent Policy Gradients},
  author = {Jakob Foerster and Gregory Farquhar and Triantafyllos Afouras and Nantas Nardelli and Shimon Whiteson},
  journal= {arXiv preprint arXiv:1705.08926},
  year   = {2024}
}