DeepSafeMPC:用于安全多智能体强化学习的基于深度学习的模型预测控制
机器学习
2024-03-13 v2 人工智能
系统与控制
系统与控制
摘要
近年来,安全多智能体强化学习日益受到关注,其强调智能体不仅要优化全局回报,还要通过行为约束遵守安全要求。最近的一些工作将控制理论与多智能体强化学习相结合,以应对确保安全性的挑战。然而,模型预测控制(MPC)方法在该领域的应用一直非常有限,这主要是由于多智能体环境具有复杂且隐式的动态特性。为了弥合这一差距,我们提出了一种名为用于安全多智能体强化学习的基于深度学习的模型预测控制的新方法。DeepSafeMPC 的关键见解是利用集中式深度学习模型来很好地预测环境动态。我们的方法应用 MARL 原理来搜索最优解。通过采用 MPC,智能体的动作可以被同时限制在安全状态内。我们使用 Safe Multi-agent MuJoCo 环境证明了我们方法的有效性,展示了在解决 MARL 安全性问题方面的显著进步。
关键词
引用
@article{arxiv.2403.06397,
title = {DeepSafeMPC: Deep Learning-Based Model Predictive Control for Safe Multi-Agent Reinforcement Learning},
author = {Xuefeng Wang and Henglin Pu and Hyung Jun Kim and Husheng Li},
journal= {arXiv preprint arXiv:2403.06397},
year = {2024}
}
备注
8 pages, 5 figures