面向协作多智能体强化学习的认证策略平滑
机器学习
2022-12-23 v1 多智能体系统
摘要
协作多智能体强化学习(c-MARL)广泛应用于安全关键场景,因此分析c-MARL模型的鲁棒性至关重要。然而,社区中尚未探索c-MARL的鲁棒性认证。本文提出一种新颖的认证方法,这是首个利用可扩展方法为c-MARL确定具有保证认证边界的动作的工作。与单智能体系统相比,c-MARL认证带来两个关键挑战:(i)随智能体数量增加的累积不确定性;(ii)将单个智能体动作改变为全局团队奖励时潜在的影响缺失。这些挑战使我们无法直接使用现有算法。因此,我们采用错误发现率(FDR)控制过程,考虑每个智能体对每状态鲁棒性认证的重要性,并提出一种基于树搜索的算法,以在最小认证扰动下寻找全局奖励的下界。由于我们的方法具有通用性,它也可应用于单智能体环境。我们通过实验表明,我们的认证边界比最先进的RL认证方案紧得多。我们还在两种不同环境、含两和四个智能体的两种流行c-MARL算法QMIX与VDN上运行实验。实验结果表明,我们的方法为所有模型与环境产生了有意义的保证鲁棒性。我们的工具CertifyCMARL可在https://github.com/TrustAI/CertifyCMA获取。
引用
@article{arxiv.2212.11746,
title = {Certified Policy Smoothing for Cooperative Multi-Agent Reinforcement Learning},
author = {Ronghui Mu and Wenjie Ruan and Leandro Soriano Marcolino and Gaojie Jin and Qiang Ni},
journal= {arXiv preprint arXiv:2212.11746},
year = {2022}
}
备注
This paper will appear in AAAI2023