用于强度学习中按状态安全的增广拉格朗日乘子网络
机器学习
2026-05-04 v1 人工智能
摘要
安全性是现实强化学习(RL)中的首要挑战。将安全要求表述为状态约束已成为流行范式。使用拉格朗日方法处理状态约束需要为每个状态分配不同的乘子,这要求神经网络对其进行近似表示。然而,将标准对偶梯度上升法应用于乘子网络会导致严重的训练振荡。这是因为对偶上升固有的不稳定性被网络泛化所加剧——局部超调和延迟更新会传播至相邻状态,进一步放大策略波动。现有稳定技术为标量乘子设计,对于状态依赖乘子网络不适用。为此,我们提出一种用于稳定学习状态乘子的增广拉格朗日乘子网络(ALaM)框架。ALaM 的关键组件包括:首先,在增广拉格朗日函数中引入二次惩罚,以补偿乘子更新的延迟效应并在最优点附近建立局部凸性,从而缓解策略振荡;其次,通过监督回归训练乘子网络以适应对偶目标,从而稳定训练并促进收敛。理论上,我们证明 ALaM 保证乘子收敛,从而恢复受约束问题的最优策略。基于此框架,我们将软演员-评论家(SAC)与 ALaM 集成,开发了 SAC-ALaM 算法。实验表明,SAC-ALaM 在安全性和回报方面均优于当前最先进的安全 RL 方法,同时稳定了训练动力学并学习出良好校准的乘子用于风险识别。
引用
@article{arxiv.2605.00667,
title = {Augmented Lagrangian Multiplier Network for State-wise Safety in Reinforcement Learning},
author = {Jiaming Zhang and Yujie Yang and Yao Lyu and Shengbo Eben Li and Liping Zhang},
journal= {arXiv preprint arXiv:2605.00667},
year = {2026}
}
备注
13 pages, 41 figures, 1 tables