带安全约束的保守分布式强化学习
机器学习
2024-10-28 v2 人工智能
摘要
安全探索可视为一个约束马尔可夫决策问题,其中期望长期代价受到约束。以往的离策略算法通过引入拉格朗日松弛技术将约束优化问题转化为相应的无约束对偶问题。然而,上述算法的代价函数估计不准确,并导致拉格朗日乘子学习的不稳定。本文提出一种名为保守分布式最大后验策略优化(CDMPO)的新型离策略强化学习算法。首先,为准确判断当前情形是否满足约束,CDMPO采用分布式强化学习方法估计Q函数和C函数。接着,CDMPO使用保守值函数损失以减少探索过程中约束违反的次数。此外,我们利用加权平均比例积分微分(WAPID)稳定地更新拉格朗日乘子。实证结果表明,所提方法在早期探索过程中约束违反更少。最终测试结果也表明我们的方法具有更好的风险控制。
引用
@article{arxiv.2201.07286,
title = {Conservative Distributional Reinforcement Learning with Safety Constraints},
author = {Hengrui Zhang and Youfang Lin and Sheng Han and Shuo Wang and Kai Lv},
journal= {arXiv preprint arXiv:2201.07286},
year = {2024}
}
备注
This work has been submitted to the IEEE for possible publication