中文

安全强化学习与约束MDP综述:单智能体与多智能体安全的技术综述

机器学习 2026-04-30 v2

摘要

安全强化学习(SafeRL)是强化学习的一个子领域,明确处理智能体学习和部署过程中的安全约束。本综述对基于约束马尔可夫决策过程(CMDP)的SafeRL公式以及多智能体安全强化学习(SafeMARL)的扩展提供了数学严谨的概述。我们回顾了CMDP的理论基础,涵盖定义、约束优化技术和基本定理。然后,我们总结了单智能体SafeRL中的最先进算法,包括具有安全保证的策略梯度方法和安全探索策略,以及SafeMARL在合作与竞争环境中的最新进展。此外,我们提出了五个开放研究问题以推动该领域发展,其中三个聚焦于SafeMARL。每个问题都附有动机、关键挑战和相关先前工作的描述。本综述旨在为对SafeRL和SafeMARL感兴趣的研究人员提供技术指南,突出关键概念、方法和未来开放研究方向。

关键词

引用

@article{arxiv.2505.17342,
  title  = {A Survey of Safe Reinforcement Learning and Constrained MDPs: A Technical Survey on Single-Agent and Multi-Agent Safety},
  author = {Ankita Kushwaha and Kiran Ravish and Preeti Lamba and Pawan Kumar},
  journal= {arXiv preprint arXiv:2505.17342},
  year   = {2026}
}

备注

25