中文

面向协作多智能体值分解 Q-Learning 的理解

机器学习 2021-11-02 v5 人工智能 多智能体系统 机器学习

摘要

值分解(value factorization)是一种流行且有前景的方法,用于扩展协作设定下的多智能体强化学习,其在学习可扩展性与值函数表示能力之间取得平衡。然而,对此类方法的理论理解尚有限。本文中,我们形式化了一个多智能体拟合 Q-迭代(fitted Q-iteration)框架,用于分析因子化多智能体 Q-learning。基于该框架,我们研究了线性值分解,并揭示出采用这种简单分解的多智能体 Q-learning 隐式地实现了一种强大的反事实信用分配(counterfactual credit assignment),但在某些设定下可能不收敛。通过进一步分析,我们发现同策略训练(on-policy training)或更丰富的联合值函数类可分别改善其局部或全局收敛性质。最后,为在实践实现中支撑我们的理论含义,我们对最先进的深度多智能体 Q-learning 算法在教学示例和广泛的 StarCraft II 单位微操任务上进行了实证分析。

关键词

引用

@article{arxiv.2006.00587,
  title  = {Towards Understanding Cooperative Multi-Agent Q-Learning with Value Factorization},
  author = {Jianhao Wang and Zhizhou Ren and Beining Han and Jianing Ye and Chongjie Zhang},
  journal= {arXiv preprint arXiv:2006.00587},
  year   = {2021}
}

备注

Thirty-fifth Conference on Neural Information Processing Systems (NeurIPS 2021)