状态对抗多智能体强化学习的求解方案是什么?
人工智能
2024-04-15 v5 计算机科学与博弈论
多智能体系统
摘要
多种多智能体强化学习(MARL)方法在智能体策略基于准确状态信息的假设下被提出。然而,通过深度强化学习(DRL)学到的策略易受对抗性状态扰动攻击的影响。本工作中,我们提出状态对抗马尔可夫博弈(SAMG),并首次尝试研究状态不确定下MARL的不同解概念。我们的分析表明,常用的最优智能体策略与鲁棒纳什均衡解概念在SAMG中并非总存在。为规避此困难,我们考虑一种称为鲁棒智能体策略的新解概念,其中智能体旨在最大化最坏情况期望状态价值。我们证明了有限状态与有限动作SAMG中鲁棒智能体策略的存在性。此外,我们提出鲁棒多智能体对抗演员-评论家(RMA3C)算法,以在状态不确定下为MARL智能体学习鲁棒策略。实验表明,面对状态扰动时我们的算法优于现有方法,并大幅提升了MARL策略的鲁棒性。我们的代码已公开于 https://songyanghan.github.io/what_is_solution/。
引用
@article{arxiv.2212.02705,
title = {What is the Solution for State-Adversarial Multi-Agent Reinforcement Learning?},
author = {Songyang Han and Sanbao Su and Sihong He and Shuo Han and Haizhao Yang and Shaofeng Zou and Fei Miao},
journal= {arXiv preprint arXiv:2212.02705},
year = {2024}
}
备注
Accepted by Transactions on Machine Learning Research (TMLR)