论协作多智能体强化学习的鲁棒性
机器学习
2020-03-10 v1 密码学与安全
机器学习
摘要
在协作多智能体强化学习(c-MARL)中,智能体作为团队学习协作采取行动以最大化团队总奖励。我们分析了c-MARL对能够攻击团队中某一智能体的对抗者的鲁棒性。通过操纵该智能体的观测,对抗者试图降低团队总奖励。攻击c-MARL面临三个挑战:首先,难以估计团队奖励或某一智能体误预测对奖励的影响;其次,模型不可微;第三,特征空间为低维。因此,我们引入了一种新颖的攻击方式。攻击者首先用强化学习训练策略网络,以找到应诱使受害智能体采取的错误动作。随后,对抗者使用定向对抗样本迫使受害智能体采取该动作。我们在StarCraft II多智能体基准上的结果表明,c-MARL团队对其某一智能体观测所受扰动高度脆弱。通过攻击单个智能体,我们的攻击方法对整体团队奖励产生高度负面影响,将其从20降至9.4。这导致团队胜率从98.9%降至0%。
引用
@article{arxiv.2003.03722,
title = {On the Robustness of Cooperative Multi-Agent Reinforcement Learning},
author = {Jieyu Lin and Kristina Dzeparoska and Sai Qian Zhang and Alberto Leon-Garcia and Nicolas Papernot},
journal= {arXiv preprint arXiv:2003.03722},
year = {2020}
}