在合作-竞争环境中平衡理性与其他关切偏好
机器学习
2021-02-25 v1 人工智能
多智能体系统
摘要
近期的强化学习研究广泛探索了混合环境中合作与竞争行为之间的相互作用。与智能体朝着共同目标努力的合作环境不同,混合环境以自私利益与社会利益的冲突而著称。因此,纯理性智能体往往难以达成并维持合作。一种诱导合作行为的普遍方法是基于其他智能体的福祉分配额外奖励。然而,该方法受多智能体信用分配问题困扰,可能阻碍性能。这一问题在合作环境中可由QMIX和COMA等最先进算法有效缓解。但当应用于混合环境时,这些算法可能导致奖励分配不公。我们提出BAROCCO,作为这些算法的扩展,能够平衡个体与社会激励。BAROCCO背后的机制是训练两个不同但相互交织的组件,共同影响每个智能体的决策。我们的元算法兼容Q学习和Actor-Critic框架。我们通过实验证实了相对于现有方法的优势,并在两个混合多智能体设置中探究了BAROCCO的行为特性。
引用
@article{arxiv.2102.12307,
title = {Balancing Rational and Other-Regarding Preferences in Cooperative-Competitive Environments},
author = {Dmitry Ivanov and Vladimir Egorov and Aleksei Shpilman},
journal= {arXiv preprint arXiv:2102.12307},
year = {2021}
}
备注
Short version of this paper is accepted to AAMAS 2021