中文

去中心化合作多智能体强化学习中的公平策略学习

机器学习 2021-06-23 v4 人工智能 多智能体系统

摘要

我们考虑在(深度)合作多智能体强化学习(MARL)中学习公平策略的问题。我们以原则性的方式将其形式化为优化一个福利函数的问题,该函数显式编码了公平的两个重要方面:效率与公平。作为一种求解方法,我们提出一种新颖的神经网络架构,其由两个专门设计用于考虑公平两方面子网络组成。在实验中,我们展示了两个子网络对公平优化的重要性。我们的整体方法是通用的,因为它可以容纳任何(子)可微的福利函数。因此,它与文献中提出的各种公平概念兼容(例如,字典序极大极小、广义基尼社会福利函数、比例公平)。我们的求解方法是通用的,可在各种MARL设定中实现:集中训练与去中心化执行,或完全去中心化。最后,我们在各种领域上实验验证我们的方法,并展示其性能远优于以往方法。

关键词

引用

@article{arxiv.2012.09421,
  title  = {Learning Fair Policies in Decentralized Cooperative Multi-Agent Reinforcement Learning},
  author = {Matthieu Zimmer and Claire Glanois and Umer Siddique and Paul Weng},
  journal= {arXiv preprint arXiv:2012.09421},
  year   = {2021}
}

备注

International Conference on Machine Learning