去中心化合作多智能体强化学习中的公平策略学习
机器学习
2021-06-23 v4 人工智能
多智能体系统
摘要
我们考虑在(深度)合作多智能体强化学习(MARL)中学习公平策略的问题。我们以原则性的方式将其形式化为优化一个福利函数的问题,该函数显式编码了公平的两个重要方面:效率与公平。作为一种求解方法,我们提出一种新颖的神经网络架构,其由两个专门设计用于考虑公平两方面子网络组成。在实验中,我们展示了两个子网络对公平优化的重要性。我们的整体方法是通用的,因为它可以容纳任何(子)可微的福利函数。因此,它与文献中提出的各种公平概念兼容(例如,字典序极大极小、广义基尼社会福利函数、比例公平)。我们的求解方法是通用的,可在各种MARL设定中实现:集中训练与去中心化执行,或完全去中心化。最后,我们在各种领域上实验验证我们的方法,并展示其性能远优于以往方法。
引用
@article{arxiv.2012.09421,
title = {Learning Fair Policies in Decentralized Cooperative Multi-Agent Reinforcement Learning},
author = {Matthieu Zimmer and Claire Glanois and Umer Siddique and Paul Weng},
journal= {arXiv preprint arXiv:2012.09421},
year = {2021}
}
备注
International Conference on Machine Learning