使用平均场控制近似协作异构多智能体强化学习
机器学习
2022-05-10 v3 人工智能
计算机科学与博弈论
多智能体系统
摘要
平均场控制(MFC)是缓解协作多智能体强化学习(MARL)问题维度灾难的有效方法。本文考虑一个包含 个异构智能体的集合,这些智能体可被划分为 个类别,使得第 类包含 个同质智能体。我们的目标是证明该异构系统的MARL问题可通过其对应的MFC问题得到近似保证。我们考虑了三种场景,其中所有智能体的奖励和转移动态分别被视为以下各项的函数:(1) 所有类别的联合状态和动作分布,(2) 每个类别的个体分布,以及 (3) 整个总体的边缘分布。我们证明,在这些情况下, 类MARL问题可由MFC近似,其误差分别为 , 和 ,其中 为常数, 是每个智能体状态空间和动作空间的大小。最后,我们设计了一种基于自然策略梯度(NPG)的算法,在上述三种情况下,该算法能够分别以 的样本复杂度收敛到误差在 内的最优MARL策略,其中 。
引用
@article{arxiv.2109.04024,
title = {On the Approximation of Cooperative Heterogeneous Multi-Agent Reinforcement Learning (MARL) using Mean Field Control (MFC)},
author = {Washim Uddin Mondal and Mridul Agarwal and Vaneet Aggarwal and Satish V. Ukkusuri},
journal= {arXiv preprint arXiv:2109.04024},
year = {2022}
}
备注
46 pages