中文

面向连续动作空间多智能体系统的安全深度强化学习

机器学习 2021-08-12 v2 机器人学

摘要

多智能体控制问题构成了具有连续动作空间的深度强化学习模型的一个有趣应用领域。然而,此类现实应用通常带有必须满足、不可违反的关键安全约束。为保障安全,我们通过向深度策略网络添加安全层,增强了知名的多智能体深度确定性策略梯度(MADDPG)框架。具体而言,我们将单智能体系统Safe DDPG(Dalal等,2018)中所做的单步转移动力学线性化思想推广至多智能体设定。此外,我们提议利用软约束(Kerrigan & Maciejowski,2000)规避动作修正步骤中的不可行问题。精确罚函数理论的结果可用于在温和假设下保证软约束的约束满足。我们通过实验发现,软公式实现了约束违反的大幅下降,使得在学习过程中也能保障安全。

关键词

引用

@article{arxiv.2108.03952,
  title  = {Safe Deep Reinforcement Learning for Multi-Agent Systems with Continuous Action Spaces},
  author = {Ziyad Sheebaelhamd and Konstantinos Zisis and Athina Nisioti and Dimitris Gkouletsos and Dario Pavllo and Jonas Kohler},
  journal= {arXiv preprint arXiv:2108.03952},
  year   = {2021}
}

备注

ICML 2021 Workshop on Reinforcement Learning for Real Life