STAS:面向多智能体强化学习的时空回报分解
人工智能
2024-01-05 v2 机器学习
摘要
集中训练分散执行(CTDE)已被证明是协作式多智能体强化学习(MARL)中的一种有效范式。主要挑战之一是信用分配,旨在依据智能体的贡献进行归因。尽管先前研究取得巨大成功,其方法通常无法在全局奖励仅在回合结束时揭晓的回合制强化学习场景中奏效。它们缺乏在时维上建模延迟全局奖励复杂关系的功能而效率低下。为此,我们引入带 Shapley 值的时空注意力(STAS),一种在时、空两个维度学习信用分配的新方法。它首先将全局回报分解回每个时间步,然后利用 Shapley 值从分解后的全局奖励中重新分配个体收益。为缓解 Shapley 值的计算复杂性,我们引入边际贡献的近似并利用蒙特卡洛采样进行估计。我们在一个 Alice & Bob 示例和 MPE 环境的多种场景下评估了我们的方法。结果表明,我们的方法有效分配时空信用,优于所有最先进的基线。
引用
@article{arxiv.2304.07520,
title = {STAS: Spatial-Temporal Return Decomposition for Multi-agent Reinforcement Learning},
author = {Sirui Chen and Zhaowei Zhang and Yaodong Yang and Yali Du},
journal= {arXiv preprint arXiv:2304.07520},
year = {2024}
}