中文

从累积约束到非平稳强化学习的自适应运行时安全控制

机器学习 2026-05-20 v1

摘要

强化学习中的安全通常通过累积成本约束来指定,但这些轨迹级保证并不直接防止不安全的单个决策,尤其是在非平稳情境下更为突出。由于同一动作在不同情境下的风险可能不同,而固定的状态级阈值可能过于保守或不足。我们提出了约束投影安全盾(Constraint Projection Safety Shield, CPSS),这是一种在运行时将累积安全预算转化为自适应状态级控制约束的机制。CPSS 跟踪剩余安全预算,将其投影为随时间变化的可接受风险阈值,并过滤预测安全成本超过活跃阈值的策略动作。该阈值通过情境信号在线调整,以便在更具挑战性或快速变化的情境下加强执行,反之则放宽。我们分析了受保护策略,证明该机制保证所执行动作的 per-state 阈值满足,诱导有限时域累积成本上界,并给出以干预频率和每步奖励扭曲程度为界的性能下降界。我们在非平稳的高速公路合并情境中使用 highway-env 对 CPSS 进行评估。结果显示,在多个随机种子下,CPSS 在接近度方面的安全违规大幅减少,同时在选择性干预的情况下显著提升了分离间距,而非支配整个学习策略。这些结果支持将累积安全规范转化为有效的本地安全控制的自适应预算到阈值投影作为持续强化学习系统的实用方法。

引用

@article{arxiv.2605.18841,
  title  = {From Cumulative Constraints to Adaptive Runtime Safety Control for Nonstationary Reinforcement Learning},
  author = {Timofey Tomashevskiy},
  journal= {arXiv preprint arXiv:2605.18841},
  year   = {2026}
}

备注

13 pages. Preprint version