中文

面向多约束安全强化学习的梯度整形

机器学习 2023-12-27 v1

摘要

在线安全强化学习 (RL) 涉及通过与环境交互来训练策略,以在满足约束的同时最大化任务效率。本文聚焦于解决多约束 (MC) 安全 RL 问题相关的复杂挑战。我们从多目标优化 (MOO) 的角度处理安全 RL 问题,并提出一个专为 MC 安全 RL 算法设计的统一框架。该框架强调对源自约束的梯度进行操纵。利用该框架的见解并认识到冗余和冲突约束条件的重要性,我们引入了梯度整形 (GradS) 方法,用于通用的基于拉格朗日的安全 RL 算法,以提高奖励和约束满足方面的训练效率。广泛的实验表明,我们提出的方法在鼓励探索以及学习能同时提高安全性和奖励表现的策略方面是有效的,适用于各种具有挑战性的 MC 安全 RL 任务,并且对约束数量具有良好的可扩展性。

关键词

引用

@article{arxiv.2312.15127,
  title  = {Gradient Shaping for Multi-Constraint Safe Reinforcement Learning},
  author = {Yihang Yao and Zuxin Liu and Zhepeng Cen and Peide Huang and Tingnan Zhang and Wenhao Yu and Ding Zhao},
  journal= {arXiv preprint arXiv:2312.15127},
  year   = {2023}
}