LexiSafe:基于 lexicographic 安全-奖励层级的离线安全强化学习
机器学习
2026-03-12 v2 系统与控制
系统与控制
摘要
离线安全强化学习(RL)在网络-物理系统(CPS)中日益受到重视,其中训练期间的安全违规是不可接受的,且仅可获得预收集的数据。现有的离线安全RL方法通常通过松弛约束或联合优化来平衡奖励-安全权衡,但缺乏防止安全漂移的结构性机制。我们提出LexiSafe,一种面向保持安全对齐行为的 lexicographic 离线RL框架。我们首先开发LexiSafe-SC,一种用于标准离线安全RL的单一成本公式,推导出安全违规与性能次优性界限,从而获得样本复杂度保证。随后我们扩展框架以支持多成本层次安全要求的LexiSafe-MC。实验表明,LexiSafe在受约束的离线基线方法下显著减少安全违规并提升任务性能。通过将 lexicographic 优先级与结构性偏置统一,LexiSafe为面向安全关键CPS决策提供了一种实用且理论依据扎实的方法。
引用
@article{arxiv.2602.17312,
title = {LexiSafe: Offline Safe Reinforcement Learning with Lexicographic Safety-Reward Hierarchy},
author = {Hsin-Jung Yang and Zhanhong Jiang and Prajwal Koirala and Qisai Liu and Cody Fleming and Soumik Sarkar},
journal= {arXiv preprint arXiv:2602.17312},
year = {2026}
}
备注
17th ACM/IEEE International Conference on Cyber-Physical Systems