面向安全强化学习的自适应原始-对偶方法
机器学习
2024-02-02 v1 人工智能
最优化与控制
摘要
原始-对偶方法在安全强化学习(SRL)中有着自然的应用,其被表述为受约束的策略优化问题。然而在实践中,将原始-对偶方法应用于 SRL 具有挑战性,因为每次求解嵌入的无约束 RL 问题时,学习率(LR)和拉格朗日乘子(对偶变量)之间存在相互依赖关系。在本文中,我们针对 SRL 提出、分析并评估了自适应原始-对偶(APD)方法,其中两个自适应 LR 被调整以适应拉格朗日乘子,从而在每次迭代中优化策略。我们在理论上确立了 APD 算法的收敛性、最优性和可行性。最后,我们在 Bullet-Safey-Gym 的四个知名环境中,采用两种最先进的 SRL 算法:PPO-Lagrangian 和 DDPG-Lagrangian,对实用的 APD 算法进行了数值评估。所有实验表明,实用的 APD 算法优于(或达到相当的性能)恒定 LR 情况,并获得更稳定的训练。此外,我们通过经验证据证实了选择这两个自适应 LR 的稳健性。
引用
@article{arxiv.2402.00355,
title = {Adaptive Primal-Dual Method for Safe Reinforcement Learning},
author = {Weiqin Chen and James Onyejizu and Long Vu and Lan Hoang and Dharmashankar Subramanian and Koushik Kar and Sandipan Mishra and Santiago Paternain},
journal= {arXiv preprint arXiv:2402.00355},
year = {2024}
}