拉格朗日如何指引扩散模型中的安全强化学习?
机器学习
2026-05-07 v2 系统与控制
系统与控制
摘要
扩散策略采样使强化学习能够表征超越次优单模高斯策略的多模态动作分布。然而,现有扩散-based 强化学习方法主要关注离线奖励最大化,仅限于在线安全设置中有限的考虑。为填补这一空白,我们提出了增强拉格朗日导向扩散 (ALGD),一种用于离策略安全强化学习的新型算法。我们通过重访优化理论和能量基模型,表明原始-对偶方法的不稳定性源于拉格朗日函数在非凸景观中的表现。在扩散-based 安全强化学习中,拉格朗日可被解释为引导去噪动力学的能量函数。出乎意料的是,直接使用会破坏策略生成和训练过程。ALGD 通过引入增强拉格朗日函数,在能量景观局部凸化,从而实现稳定的策略生成和训练过程,而无需改变最优策略的分布。理论分析和大量实验表明,ALGD 既在理论上有据可依,在实践中也表现出色,在多样化的环境中实现了强大且稳定的性能。
引用
@article{arxiv.2602.02924,
title = {How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?},
author = {Xiaoyuan Cheng and Wenxuan Yuan and Boyang Li and Yuanchao Xu and Yiming Yang and Hao Liang and Bei Peng and Robert Loftin and Zhuo Sun and Yukun Hu},
journal= {arXiv preprint arXiv:2602.02924},
year = {2026}
}