中文

通过屏蔽实现安全多智能体强化学习

机器学习 2021-02-03 v2 形式语言与自动机理论

摘要

多智能体强化学习(MARL)已日益广泛应用于一系列安全关键应用,这些应用要求在学习过程中保证安全性(例如,绝不访问任何不安全状态)。遗憾的是,当前 MARL 方法不具备安全性保证。因此,我们提出两种用于安全 MARL 的屏蔽方法。在集中式屏蔽中,我们合成单一屏蔽来监控所有智能体的联合动作,并在必要时纠正任何不安全动作。在因子化屏蔽中,我们基于所有智能体观测到的联合状态空间的一个因子分解合成多个屏蔽;这组屏蔽并发监控智能体,且每个屏蔽在每一步仅负责智能体的一个子集。实验结果表明,两种方法均能在学习过程中保证智能体安全而不损害所学策略的质量;此外,因子化屏蔽在智能体数量上比集中式屏蔽更具可扩展性。

关键词

引用

@article{arxiv.2101.11196,
  title  = {Safe Multi-Agent Reinforcement Learning via Shielding},
  author = {Ingy Elsayed-Aly and Suda Bharadwaj and Christopher Amato and Rüdiger Ehlers and Ufuk Topcu and Lu Feng},
  journal= {arXiv preprint arXiv:2101.11196},
  year   = {2021}
}

备注

8 pages, 11 figures and 2 tables, to be published in AAMAS 2021