中文

安全强化学习:基于梯度操作的奖励与安全平衡

机器学习 2025-03-04 v3 人工智能

摘要

确保强化学习(RL)在实际应用中的安全性是其部署的关键要求。然而,在探索过程中在奖励和安全之间进行权衡 presents a significant challenge。通过调整策略来提高奖励性能可能对安全性能产生不利影响。本研究旨在通过利用梯度操作理论来解决上述冲突关系。首先,我们分析了奖励梯度与安全梯度之间的冲突。随后,我们提出一种软切换策略优化方法,并提供了收敛分析。基于我们的理论检验,我们提供了一种安全RL框架来克服上述挑战,我们开发了一个Safety-MuJoCo基准测试来评估安全RL算法的性能。最后,我们在Safety-MuJoCo基准测试和流行的安全RL基准Omnisafe上评估了我们方法的有效性。实验结果表明,我们的算法在奖励和安全优化之间进行平衡方面优于几个最先进的基线方法。

关键词

引用

@article{arxiv.2405.01677,
  title  = {Balance Reward and Safety Optimization for Safe Reinforcement Learning: A Perspective of Gradient Manipulation},
  author = {Shangding Gu and Bilgehan Sel and Yuhao Ding and Lu Wang and Qingwei Lin and Ming Jin and Alois Knoll},
  journal= {arXiv preprint arXiv:2405.01677},
  year   = {2025}
}