面向长期安全的可行性感知式悲观估计:离线强化学习
机器学习
2025-06-02 v2
摘要
离线安全强化学习(OSRL)从预收集的数据集中派生出满足约束的策略,为在安全关键领域如机器人等领域部署RL提供了可行的途径。然而,大多数现有方法仅强调短期安全,忽视了长期考虑。因此,他们可能在在线部署期间违反安全约束,无法确保持续的保护。此外,所学策略往往难以处理来自离线数据集中缺失或超出分布(OOD)的状态和动作,样本效率也有限。为此,我们提出一种新框架:基于CVAE的可行性感知式离线安全强化学习(FASP)。首先,我们采用哈密顿-约翰(H-J)可达性分析生成可靠的安全标签,作为训练条件变分自编码器(CVAE)和安全分类器的监督信号。该方法不仅确保高采样效率,还提供严格的长期安全保证。此外,我们利用悲观估计方法对奖励和成本的Q值进行估计,这有助于缓解由OOD动作引起的外推误差,并对不安全动作进行惩罚,以便代理主动规避高风险行为。我们还理论上证明了这种悲观估计的有效性。在DSRL基准上的广泛实验表明,FASP算法在多个实验任务中均表现出竞争力,尤其在安全性方面优于当前最先进的算法。
引用
@article{arxiv.2505.08179,
title = {Feasibility-Aware Pessimistic Estimation: Toward Long-Horizon Safety in Offline RL},
author = {Zhikun Tao},
journal= {arXiv preprint arXiv:2505.08179},
year = {2025}
}
备注
arXiv admin comment: This version removed due to inaccurate authorship