中文

基于逆受限强化学习的安全强化学习漏洞分析

机器学习 2026-02-19 v1

摘要

安全强化学习(Safe RL)旨在确保策略性能的同时满足安全约束。然而,大多数现有 Safe RL 方法假设友好环境,使其对现实场景中常见的对抗性扰动脆弱。此外,现有基于梯度的对抗攻击通常需要访问策略的梯度信息,而这在现实场景中往往不实用。为此,我们提出一种对抗攻击框架,以揭示 Safe RL 策略的漏洞。通过专家演示和黑盒环境交互,我们的框架学习约束模型和替代(学习者)策略,实现无需 victim 策略内部梯度或真实安全约束即可进行梯度攻击优化。我们进一步提供了理论分析,建立了可行性并推导了扰动界限。在多个 Safe RL 基准测试上进行的实验表明,在受限特权访问下,我们的方法有效。

关键词

引用

@article{arxiv.2602.16543,
  title  = {Vulnerability Analysis of Safe Reinforcement Learning via Inverse Constrained Reinforcement Learning},
  author = {Jialiang Fan and Shixiong Jiang and Mengyu Liu and Fanxin Kong},
  journal= {arXiv preprint arXiv:2602.16543},
  year   = {2026}
}

备注

12 pages, 6 figures, supplementary material included