中文

安全强化学习中拉格朗日方法的实用理解

机器学习 2026-03-24 v2 人工智能 机器人学 系统与控制 系统与控制

摘要

安全强化学习解决的是需在性能最大化与安全约束之间进行权衡的约束优化问题,拉格朗日方法是此类问题常用的求解方法。然而,该方法的有效性在很大程度上取决于拉格朗日乘子 λ\lambda 的选择,而 λ\lambda 决定了回报与成本之间的多目标权衡。常见做法是在训练期间自动更新乘子。尽管这种做法在实际中被广泛采用,但目前仍缺乏关于 λ\lambda 可实现的最优权衡的实证证据,也没有系统性地将自动更新机制与该经验极限进行比较。因此,我们分别研究 (i) 八个广泛使用的安全任务的约束几何,以及 (ii) 不同拉格朗日乘子更新机制在安全强化学习中的约束段敏感性。通过多目标分析视角,我们呈现经验的 Pareto 前沿,以完整可视化回报与成本之间的权衡。我们的结果揭示了 λ\lambda 的高度敏感性,并进一步表明约束成本的限制性在同一任务的不同成本区间内会有所不同。这凸显了在评估安全强化学习方法时,需在不同成本限制区域谨慎选择成本上限的重要性。我们为每个评估任务提供了推荐的成本上限集合,并提供一个开源代码库: https://github.com/lindsayspoor/Lagrangian_SafeRL。

关键词

引用

@article{arxiv.2510.17564,
  title  = {Towards a Practical Understanding of Lagrangian Methods in Safe Reinforcement Learning},
  author = {Lindsay Spoor and Álvaro Serra-Gómez and Aske Plaat and Thomas Moerland},
  journal= {arXiv preprint arXiv:2510.17564},
  year   = {2026}
}