中文

状态约束策略优化

机器学习 2024-06-19 v3 机器人学

摘要

强化学习(RL)算法在仿真环境中已展现出巨大成功,但其在现实世界问题中的应用面临重大挑战,其中安全性是主要关注点。特别地,对自动驾驶和机器人操控等许多具有挑战性的任务而言,强制实施状态级约束至关重要。然而,约束马尔可夫决策过程(CMDP)框架下现有的安全 RL 算法并未考虑状态级约束。为弥补这一空白,我们提出状态约束策略优化(SCPO),这是首个面向状态约束强化学习的通用策略搜索算法。SCPO 在期望意义上为状态级约束满足提供保证。具体而言,我们引入最大马尔可夫决策过程框架,并证明在 SCPO 下最坏情况的安全性违背是有界的。我们在大量机器人运动任务上训练神经网络策略以验证我们方法的有效性,其中智能体必须满足多种状态级安全约束。我们的结果表明,SCPO 显著优于现有方法,并能够处理高维机器人任务中的状态级约束。

关键词

引用

@article{arxiv.2306.12594,
  title  = {State-wise Constrained Policy Optimization},
  author = {Weiye Zhao and Rui Chen and Yifan Sun and Tianhao Wei and Changliu Liu},
  journal= {arXiv preprint arXiv:2306.12594},
  year   = {2024}
}

备注

Published in Transactions of Machine Learning Research