中文

使用动作投影的安全强化学习:保护策略还是环境?

机器学习 2026-04-17 v2

摘要

基于投影的安全滤波器,通过将不安全动作映射到最近的安全替代动作来修改它们,被广泛用于在强化学习(RL)中强制执行安全约束。两种集成策略被广泛考虑:安全环境RL(SE-RL),其中保护措施被视为环境的一部分,以及安全策略RL(SP-RL),其中保护措施通过可微分优化层嵌入策略中。尽管它们在安全关键设置中具有实际相关性,但对其差异的正式理解尚缺乏。在本工作中,我们对SE-RL和SP-RL进行了理论比较。我们识别出每种方法受动作别名(action aliasing)影响的关键区别——一种现象,即多个不安全动作被投影到同一安全动作,导致策略梯度中的信息丢失。在SE-RL中,该效应由评论家隐式近似,而在SP-RL中,它直接表现为通过保护措施进行反向传播时的秩亏雅可比矩阵。我们的贡献有三方面:(i)在actor-critic算法语境下对SE-RL和SP-RL的统一形式化,(ii)对各自策略梯度估计的理论分析,突出动作别名的作用,以及(iii)对缓解策略的比较研究,包括一种针对SP-RL的新型基于惩罚的改进方法,与已建立的SE-RL实践保持一致。实证结果支持我们的理论预测,表明动作别名对SP-RL的损害大于对SE-RL。然而,通过适当的改进策略,SP-RL可以在一系列环境中匹配或超越改进后的SE-RL。这些发现为根据任务特征选择和细化基于投影的安全RL方法提供了可操作的见解。

关键词

引用

@article{arxiv.2509.12833,
  title  = {Safe Reinforcement Learning using Action Projection: Safeguard the Policy or the Environment?},
  author = {Hannah Markgraf and Shambhuraj Sawant and Hanna Krasowski and Lukas Schäfer and Sebastien Gros and Matthias Althoff},
  journal= {arXiv preprint arXiv:2509.12833},
  year   = {2026}
}