AIIR-MIX:多智能体强化学习遇见注意力个体内在奖励混合网络
机器学习
2023-02-21 v1 多智能体系统
摘要
推断每个智能体的贡献并为其分配相应的奖励是合作型多智能体强化学习(MARL)中的一个关键问题。先前的研究试图通过设计内在奖励函数来解决这个问题,但在这些研究中,内在奖励只是通过求和与环境奖励简单结合,这使得它们的 MARL 框架性能不尽如人意。我们在 MARL 中提出了一种名为注意力个体内在奖励混合网络(AIIR-MIX)的新方法,AIIR-MIX 的贡献如下:(a)我们构建了一个基于注意力机制的新型内在奖励网络,以使团队合作更有效。(b)我们提出了一个混合网络,能够根据环境条件的变化,非线性和动态地结合内在和外在奖励。我们在《星际争霸 II》的战斗游戏中将 AIIR-MIX 与许多最先进的(SOTA)MARL 方法进行了比较。结果表明,AIIR-MIX 表现出色,在平均测试胜率上能够击败当前先进的方法。为了验证 AIIR-MIX 的有效性,我们进行了额外的消融研究。结果表明,AIIR-MIX 可以根据每个智能体的实际贡献,动态地为其分配实时的内在奖励。
引用
@article{arxiv.2302.09531,
title = {AIIR-MIX: Multi-Agent Reinforcement Learning Meets Attention Individual Intrinsic Reward Mixing Network},
author = {Wei Li and Weiyan Liu and Shitong Shao and Shiyi Huang},
journal= {arXiv preprint arXiv:2302.09531},
year = {2023}
}