通过信任域分解处理 MARL 中的非平稳性
机器学习
2022-02-11 v2 计算机科学与博弈论
多智能体系统
摘要
非平稳性是协作多智能体强化学习(MARL)中一个棘手的问题。其原因之一是学习过程中智能体策略的变化。一些已有工作用若干种度量指标讨论了由非平稳性引起的各种后果。这使得现有算法的目标或目的不可避免地不一致且离散。在本文中,我们引入一个新概念 -度量,以显式度量策略序列的非平稳性,并可进一步证明其为连续联合策略的 KL 散度所界。一种直接但高度非平凡的方式是控制联合策略的散度,而通过对联合策略施加信任域约束难以精确估计。尽管将联合策略分解并对因子化策略施加信任域约束具有更低的计算复杂度,但如平均场近似这样的简单策略分解会导致更大的策略散度,这可视为信任域分解困境。我们将联合策略建模为成对马尔可夫随机场,并提出了基于消息传递的信任域分解网络(TRD-Net)以更准确地估计联合策略散度。通过端到端方式自适应调整局部策略信任域,建立了带信任域分解的多智能体镜像下降策略算法,称为 MAMT。MAMT 可近似约束连续联合策略的散度以满足 -平稳性并缓解非平稳性问题。与基线相比,我们的方法在不同复杂度的协作任务中能带来显著且稳定的性能提升。
引用
@article{arxiv.2102.10616,
title = {Dealing with Non-Stationarity in MARL via Trust-Region Decomposition},
author = {Wenhao Li and Xiangfeng Wang and Bo Jin and Junjie Sheng and Hongyuan Zha},
journal= {arXiv preprint arXiv:2102.10616},
year = {2022}
}
备注
39 pages, 23 figures, ICLR 2022 Camera Ready