中文

非线性系统控制的安全持续强化学习方法设计

机器学习 2025-02-25 v1 机器人学

摘要

强化学习(RL)算法已成功应用于无人机和机器人等控制任务。近年来,安全强化学习被提出以在工业和关键任务系统中安全执行 RL 算法。然而,当系统运行条件变化(如发生未知故障)时,典型的安全 RL 算法无法在保持既有知识的同时进行适应。为此提出了持续强化学习算法以解决此问题。然而,持续适应对系统安全性的影响仍是未充分研究的问题。本文我们研究安全与持续 RL 的交叉领域。首先,我们实证表明,流行的持续 RL 算法——在线弹性权重整合(online elastic weight consolidation)——在非线性系统受到变化运行条件影响时无法满足安全约束。具体而言,我们研究了 MuJoCo HalfCheetah 和 Ant 环境,涉及速度约束和突发关节损失的非平稳性。随后,我们表明使用受约束策略优化训练的智能体在持续学习环境中会遭遇灾难性遗忘。基于此,我们探索了一种简单的奖励塑形方法,以确保弹性权重整合在安全受限、非线性且非平稳动力学系统中优先记忆安全性和任务性能。

关键词

引用

@article{arxiv.2502.15922,
  title  = {On the Design of Safe Continual RL Methods for Control of Nonlinear Systems},
  author = {Austin Coursey and Marcos Quinones-Grueiro and Gautam Biswas},
  journal= {arXiv preprint arXiv:2502.15922},
  year   = {2025}
}