合作多智能体强化学习中的鲁棒性与韧性实证研究
多智能体系统
2025-10-24 v2 人工智能
机器学习
摘要
在合作型多智能体强化学习(MARL)中,人们常规做法是针对理想仿真环境中的合作性能进行超参数调优。然而,针对合作优化的策略在面临现实中的不确定性时往往难以维持鲁棒性和韧性。构建可信赖的MARL系统需要深入理解鲁棒性——即在不确定性下的稳定性——和韧性——即从冲击中恢复能力的概念——而后者在控制系统中已有研究,但在MARL领域却鲜有关注。本文进行了大规模实证研究,包含超过82,620次实验,评估了MARL中合作、鲁棒性和韧性,在4个真实环境、13种不确定性类型和15个超参数下进行。我们的关键发现包括:(1)在温和不确定性下,优化合作可提升鲁棒性和韧性,但随着扰动加剧,这一联系会逐渐削弱。鲁棒性和韧性也随算法和不确定性类型而异。(2)鲁棒性和韧性不会在不确定性模态或智能体范围之间推广:针对所有智能体动作噪声的鲁棒策略可能在单一智能体观测噪声下失效。(3)超参数调优对可信赖MARL至关重要: surprisingly,诸如参数共享、GAE和PopArt等常规做法可能损害鲁棒性,而提前停止、较高的批评学习率和Leaky ReLU则一致有助于提升。仅通过超参数优化,我们即可在所有MARL框架中显著提升合作、鲁棒性和韧性,并发现该现象也推广至鲁棒MARL方法的这些框架中。代码和结果已公开于https://github.com/BUAA-TrustworthyMARL/adv_marl_benchmark。
引用
@article{arxiv.2510.11824,
title = {Empirical Study on Robustness and Resilience in Cooperative Multi-Agent Reinforcement Learning},
author = {Simin Li and Zihao Mao and Hanxiao Li and Zonglei Jing and Zhuohang bian and Jun Guo and Li Wang and Zhuoran Han and Ruixiao Xu and Xin Yu and Chengdong Ma and Yuqing Ma and Bo An and Yaodong Yang and Weifeng Lv and Xianglong Liu},
journal= {arXiv preprint arXiv:2510.11824},
year = {2025}
}
备注
44 pages, 16 figures, NeurIPS 2025