中文

用于安全强化学习的物理模型引导最坏情况采样

机器人学 2024-12-19 v1 人工智能 机器学习

摘要

学习赋能的信息物理系统(CPS)在现实世界中的事故经常发生在具有挑战性的边缘案例中。在深度强化学习(DRL)策略的训练过程中,训练条件的标准设置要么固定在单一初始条件,要么从允许的状态空间中均匀采样。这种设置通常忽略了具有挑战性但安全攸关的边缘案例。为了弥补这一差距,本文提出了一种物理模型引导的最坏情况采样策略,用于训练能够处理安全攸关案例以实现安全保障的安全策略。此外,我们将所提出的最坏情况采样策略集成到物理约束深度强化学习框架中,为安全攸关的 CPS 构建了一种数据效率更高且更安全的学习算法。我们通过在模拟小车-杆系统、二维四旋翼、模拟和真实四足机器人上的大量实验,验证了所提出的结合 Phy-DRL 的训练策略,结果显示其采样效率显著提高,能够学习到更鲁棒的安全策略。

关键词

引用

@article{arxiv.2412.13224,
  title  = {Physics-model-guided Worst-case Sampling for Safe Reinforcement Learning},
  author = {Hongpeng Cao and Yanbing Mao and Lui Sha and Marco Caccamo},
  journal= {arXiv preprint arXiv:2412.13224},
  year   = {2024}
}

备注

under review