中文

安全流Q学习:基于可达性流政策的离线安全强化学习

机器学习 2026-03-17 v1 人工智能

摘要

离线安全强化学习(RL)旨在严格遵守安全约束的前提下,从静态数据集中寻找奖励最大化的政策。现有方法常依赖软期望成本目标或迭代生成推断,这在实际中台安全控制中可能不足。我们提出了安全流Q学习(SafeFQL),该方法将FQL扩展到安全离线RL,方法结合了基于Hamilton-Jacobi可达性的安全价值函数与高效的单步骤流政策。SafeFQL通过自一致性Bellman递归学习安全价值,通过行为克隆训练流政策,并将其蒸馊到单步骤演员中,用于奖励最大化的安全动作选择,无需在部署时进行抽样拒绝。为考虑所学习安全边界中有限数据近似误差,我们添加了一个 conformal预测校准步骤,该步骤调整安全阈值并提供有限样本的概率安全覆盖。在实际测试中,SafeFQL在离线训练成本略高于推断延迟显著低于扩散式安全生成基线的情况下,表现出在实际中台安全部署方面的优势。在船舶导航和Safety Gymnasium MuJoCo任务中,SafeFQL在保持或提高了先前离线安全RL性能的同时,显著减少了约束违规。

关键词

引用

@article{arxiv.2603.15136,
  title  = {Safe Flow Q-Learning: Offline Safe Reinforcement Learning with Reachability-Based Flow Policies},
  author = {Mumuksh Tayal and Manan Tayal and Ravi Prakash},
  journal= {arXiv preprint arXiv:2603.15136},
  year   = {2026}
}

备注

24 pages, 6 figures, 4 tables