训练时进行安全过滤:提升强化学习智能体的性能和样本效率
机器人学
2024-12-20 v2 机器学习
系统与控制
系统与控制
摘要
强化学习(RL)控制器灵活且性能优越,但很少能保证安全。安全过滤器在保持灵活性的同时,为RL控制器提供了硬性的安全保障。然而,由于控制器和安全过滤器之间的分离,安全过滤器可能导致不良行为,通常会降低性能和鲁棒性。在本文中,我们分析了将安全过滤器整合到RL控制器训练中的几种修改方案,而不是仅在评估期间应用它。这些修改允许RL控制器学习考虑安全过滤器,从而提高性能。本文对使用安全过滤器训练RL进行了全面分析,包括使用Crazyflie 2.0无人机进行的模拟和真实世界实验。我们研究了各种训练修改和超参数如何影响性能、样本效率、安全性和颤振。我们的研究结果为专注于安全过滤器和安全RL的从业者和研究人员提供了指导。
引用
@article{arxiv.2410.11671,
title = {Safety Filtering While Training: Improving the Performance and Sample Efficiency of Reinforcement Learning Agents},
author = {Federico Pizarro Bejarano and Lukas Brunke and Angela P. Schoellig},
journal= {arXiv preprint arXiv:2410.11671},
year = {2024}
}
备注
8 pages, 9 figures. Code is publicly available at https://github.com/Federico-PizarroBejarano/safe-control-gym/tree/training_rl_paper