RACA:多智能体深度强化学习中即席协作的关系感知信用分配方法
机器学习
2022-06-06 v1 人工智能
摘要
近年来,强化学习在多智能体领域面临若干挑战,例如信用分配问题。价值函数分解成为在集中训练与分散执行(CTDE)范式下处理信用分配问题的一种有前景的方法。然而,现有的价值函数分解方法无法处理即席协作,即在测试时适应新的队友配置。具体而言,这些方法未显式利用智能体之间的关系,且无法适应不同大小的输入。为应对这些局限,我们提出一种称为关系感知信用分配(RACA)的新方法,其在即席协作场景中实现零样本泛化。RACA利用基于图的关系编码器来编码智能体之间的拓扑结构。此外,RACA采用基于注意力的观测抽象机制,能以固定数量的参数泛化到任意数量的队友。实验表明,我们的方法在StarCraftII微操基准和即席协作场景上优于基线方法。
引用
@article{arxiv.2206.01207,
title = {RACA: Relation-Aware Credit Assignment for Ad-Hoc Cooperation in Multi-Agent Deep Reinforcement Learning},
author = {Hao Chen and Guangkai Yang and Junge Zhang and Qiyue Yin and Kaiqi Huang},
journal= {arXiv preprint arXiv:2206.01207},
year = {2022}
}
备注
Accepted at IJCNN 2022 (Oral)