中文

面向安全高效的离线强化学习:基于 Epigraph 引导的流匹配

机器学习 2026-02-10 v1 人工智能

摘要

离线强化学习 (RL) 为在安全关键领域无需在线探索的情况下训练自主系统提供了具有吸引力的范式。然而,如何从固定数据集中同时实现卓越的安全性和性能仍然具有挑战性。现有的安全离线 RL 方法常依赖软约束,允许违规、过于保守,或难以平衡安全、奖励优化与数据分布的遵循。为此,我们提出 Epigraph 引导的流匹配 (EpiFlow),将安全离线 RL 表述为状态约束最优控制问题,以协同优化安全性和性能。我们学习从最优控制问题的 Epigraph 重构中派生的可行性价值函数,从而避免先前工作中常见的解耦目标或事后过滤。通过基于该 Epigraph 价值函数对行为分布进行重新加权,并通过流匹配拟合生成式策略,实现了高效、分布一致的采样。在包括 Safety-Gymnasium 基准在内的各种安全关键任务中,EpiFlow 在接近零实证安全违规的同时实现了竞争性回报,展示了 Epigraph 引导策略合成的有效性。

关键词

引用

@article{arxiv.2602.08054,
  title  = {Epigraph-Guided Flow Matching for Safe and Performant Offline Reinforcement Learning},
  author = {Manan Tayal and Mumuksh Tayal},
  journal= {arXiv preprint arXiv:2602.08054},
  year   = {2026}
}

备注

23 pages, 8 figures