中文

安全 Langevin Soft Actor Critic

机器学习 2026-02-03 v1

摘要

在受限强化学习中平衡奖励与安全性仍具有挑战,由于在锋利值极小处的poor generalization以及对重尾风险分布的处理不足。我们引入 Safe Langevin Soft Actor-Critic (SL-SAC),一种原则化的算法,通过参数空间探索和分布式风险控制来解决这两个问题。我们的方法结合了三个关键机制:(1) 自适应随机梯度 Langevin 动力学 (aSGLD) 用于奖励 critic,通过促进 ensemble 多样性和逃离 poor optima;(2) 通过隐式分位网络 (IQN) 实现的分布式成本估计,采用条件价值 at-risk (CVaR) 优化以缓解尾部风险;(3) 一种基于经验 CVaR 的 episodic 成本的反应式 Lagrangian 松弛方案,用于适应约束执行。我们提供了 CVaR 估计误差的理论保证,并表明 CVaR 基于的 Lagrange 更新比 expected-cost 更新提供更强的约束违反信号。在 Safety-Gymnasium benchmark 上,SL-SAC 在 7 个任务中实现最低 cost,同时保持有竞争力的回报,在 velocity 任务中相对于 state-of-the-art baseline 实现 19-63% 的 cost 降低。

关键词

引用

@article{arxiv.2602.00587,
  title  = {Safe Langevin Soft Actor Critic},
  author = {Mahesh Keswani and Samyak Jain and Raunak P. Bhattacharyya},
  journal= {arXiv preprint arXiv:2602.00587},
  year   = {2026}
}

备注

20 pages, 12 figures