增强 QMIX 对抗状态对抗攻击的鲁棒性
机器学习
2024-03-07 v1 密码学与安全
多智能体系统
摘要
深度强化学习(DRL)的性能通常受到状态对抗攻击(施加于智能体观测上的扰动)的影响。近期大多数研究集中于鲁棒的单智能体强化学习(SARL)算法以抵御状态对抗攻击。然而,关于鲁棒多智能体强化学习的工作仍很少。我们以流行的协作多智能体强化算法之一 QMIX 为例,讨论了改进 SARL 算法鲁棒性的四种技术,并将其扩展到多智能体场景。为提高多智能体强化学习(MARL)算法的鲁棒性,我们在本研究中使用多种攻击对模型进行训练,然后在训练阶段通过对模型施加相应攻击,用其他攻击测试所训练的模型。通过这种方式,我们整理并总结了将技术用于 MARL 时增强鲁棒性的方法。
引用
@article{arxiv.2307.00907,
title = {Enhancing the Robustness of QMIX against State-adversarial Attacks},
author = {Weiran Guo and Guanjun Liu and Ziyuan Zhou and Ling Wang and Jiacun Wang},
journal= {arXiv preprint arXiv:2307.00907},
year = {2024}
}