学习恢复以实现安全强化学习
人工智能
2023-09-22 v1
摘要
安全控制器被广泛用于实现安全强化学习。多数应用安全控制器的方法使用手工设计的安全约束来构建安全控制器。然而,当环境动态复杂时,手工设计的安全约束变得不可用。因此,研究通过学习算法构建安全控制器具有价值。我们提出一种用于安全强化学习的三阶段架构,即TU-Recovery架构。在任务训练前先学习一个安全评判器与一个恢复策略,它们构成安全控制器以在任务训练中保障安全。随后描述了由任务策略与恢复策略不一致引发的现象,称为对抗现象,其降低了学习效率与模型性能。提出辅助奖励以缓解对抗现象,同时帮助任务策略从高风险状态学习恢复。在机器人导航环境中进行了一系列实验。实验表明,TU-Recovery在任务训练中的奖励获取与约束违反方面均优于无约束对照,且辅助奖励通过显著减少约束违反进一步提升了TU-Recovery的奖励成本比。
引用
@article{arxiv.2309.11907,
title = {Learning to Recover for Safe Reinforcement Learning},
author = {Haoyu Wang and Xin Yuan and Qinqing Ren},
journal= {arXiv preprint arXiv:2309.11907},
year = {2023}
}