通过对抗正则化实现鲁棒多智能体强化学习:理论基础与稳定算法
机器学习
2023-10-18 v1
摘要
多智能体强化学习(MARL)在多个领域已展现出有前景的结果。尽管有此前景,MARL 策略往往缺乏鲁棒性,因而对其环境中的微小变化敏感。这对 MARL 算法在真实世界的部署提出了严重关切,因为测试环境可能与训练环境略有不同。在本工作中,我们表明可以通过控制策略的 Lipschitz 常数来获得鲁棒性,并且在温和条件下,确立了一个 Lipschitz 且接近最优的策略的存在性。基于这些见解,我们提出一个新的鲁棒 MARL 框架 ERNIE,通过对抗正则化来促进策略关于状态观测和动作的 Lipschitz 连续性。ERNIE 框架提供了针对噪声观测、变化的转移动态以及智能体的恶意动作的鲁棒性。然而,ERNIE 的对抗正则化可能引入一些训练不稳定性。为减少这种不稳定性,我们将对抗正则化重新表述为一个 Stackelberg 博弈。我们在交通灯控制和粒子环境中通过大量实验证明了所提框架的有效性。此外,我们将 ERNIE 扩展到平均场 MARL,基于分布鲁棒优化的公式,其优于其非鲁棒对应方法,并且具有独立意义。我们的代码可在 https://github.com/abukharin3/ERNIE 获取。
引用
@article{arxiv.2310.10810,
title = {Robust Multi-Agent Reinforcement Learning via Adversarial Regularization: Theoretical Foundation and Stable Algorithms},
author = {Alexander Bukharin and Yan Li and Yue Yu and Qingru Zhang and Zhehui Chen and Simiao Zuo and Chao Zhang and Songan Zhang and Tuo Zhao},
journal= {arXiv preprint arXiv:2310.10810},
year = {2023}
}
备注
33 pages, 10 figures