状态约束安全强化学习:综述
机器学习
2023-07-04 v3 人工智能
机器人学
摘要
尽管强化学习(RL)算法在仿真环境中取得了巨大成功,但将RL应用于现实世界仍面临诸多挑战。一个主要关切是安全性,换言之,即约束满足。状态约束是现实应用中最常见的约束之一,也是安全RL中最具挑战性的约束之一。对自动驾驶、机器人操控等许多艰巨任务而言,强制执行状态约束必要且关键。本文全面综述了现有处理RL中状态约束的方法。在状态约束马尔可夫决策过程(SCMDP)框架下,我们将从以下方面讨论现有方法的联系、差异与权衡:(i)安全保证与可扩展性,(ii)安全性与奖励性能,以及(iii)收敛后安全性与训练期间安全性。我们还总结了当前方法的局限并探讨了潜在未来方向。
引用
@article{arxiv.2302.03122,
title = {State-wise Safe Reinforcement Learning: A Survey},
author = {Weiye Zhao and Tairan He and Rui Chen and Tianhao Wei and Changliu Liu},
journal= {arXiv preprint arXiv:2302.03122},
year = {2023}
}
备注
IJCAI Survey Track 2023