在多智能体环境中发现因果性以实现高效协作
人工智能
2023-06-22 v1 机器学习
多智能体系统
统计方法学
摘要
在协作式多智能体强化学习(MARL)中,智能体需作为团队学习行为以达成共同目标。然而,在学习任务时,部分智能体可能学到次优策略,不对团队目标做出贡献。此类智能体因其不协作行为(可能源于未能理解自身是否导致了奖励)被称为懒惰智能体。因此,我们观察到协作行为的涌现未必是作为团队解决任务能力的副产品。本文研究因果性在MARL中的应用,以及其如何用于惩罚这些懒惰智能体。我们观察到因果性估计可用于改进对智能体的信用分配,并展示其如何被用于改进MARL中的独立学习。此外,我们研究如何使用摊销因果发现(Amortized Causal Discovery)在MARL环境中自动检测因果性。结果表明,个体观测与团队奖励之间的因果关系可用于检测并惩罚懒惰智能体,使其发展出更智能的行为。这不仅提升了团队整体表现,也提升了个体能力。另外,结果显示摊销因果发现可高效用于寻找MARL中的因果关系。
引用
@article{arxiv.2306.11846,
title = {Discovering Causality for Efficient Cooperation in Multi-Agent Environments},
author = {Rafael Pina and Varuna De Silva and Corentin Artaud},
journal= {arXiv preprint arXiv:2306.11846},
year = {2023}
}