中文

回归基点:基于可达-避免安全滤波器的安全复位迈向免手动学习

系统与控制 2025-06-04 v2 机器人学 系统与控制

摘要

设计既能完成任务又能保证安全约束的控制器仍然是一个重大挑战。我们通常希望智能体在名义任务(例如环境探索)中表现良好,同时确保其能够避免不安全状态并在特定时间内返回到期望目标。特别地,我们的动机是现实世界中强化学习的安全、高效、免手动训练场景。通过使机器人能够安全且自主地复位到期望区域(例如充电站)而无需人工干预,我们可以提高效率并促进训练。安全滤波器(例如基于控制障碍函数的滤波器)将安全性与名义控制目标解耦,并严格保证安全性。尽管取得了成功,但在具有控制约束和系统不确定性的一般非线性系统中构造这些函数仍然是一个开放问题。本文引入了一种由可达-避免问题相关的值函数获得的安全滤波器。所提出的安全滤波器在避免不安全区域并引导系统返回期望目标集的同时,对名义控制器进行最小程度的修改。通过在保持策略性能的同时允许安全复位,我们实现了高效的免手动强化学习,并推进了现实世界机器人安全训练的可行性。我们使用 soft actor-critic 的修改版本,在修改过的 cartpole 稳定问题上安全地训练了一个摆起任务,以此验证了我们的方法。

关键词

引用

@article{arxiv.2501.02620,
  title  = {Back to Base: Towards Hands-Off Learning via Safe Resets with Reach-Avoid Safety Filters},
  author = {Azra Begzadić and Nikhil Uday Shinde and Sander Tonkens and Dylan Hirsch and Kaleb Ugalde and Michael C. Yip and Jorge Cortés and Sylvia Herbert},
  journal= {arXiv preprint arXiv:2501.02620},
  year   = {2025}
}

备注

The first three authors contributed equally to the work