GoSafeOpt:面向动力系统全局优化的可扩展安全探索
机器学习
2023-06-13 v5 系统与控制
系统与控制
摘要
直接在物理系统上学习最优控制策略具有挑战性,因为即使单次失败也可能导致昂贵的硬件损坏。大多数现有的无模型学习方法在探索期间保证安全(即无失败),但仅限于局部最优。一个值得注意的例外是 GoSafe 算法,但不幸的是,它无法处理高维系统,因此不能应用于大多数现实世界的动力系统。本文提出 GoSafeOpt,作为首个能够在高维系统中安全地发现全局最优策略,同时提供安全性和最优性保证的算法。我们在一个对 GoSafe 而言无法处理的机器人手臂上,展示了 GoSafeOpt 相对于竞争性无模型安全学习方法的优越性。
引用
@article{arxiv.2201.09562,
title = {GoSafeOpt: Scalable Safe Exploration for Global Optimization of Dynamical Systems},
author = {Bhavya Sukhija and Matteo Turchetta and David Lindner and Andreas Krause and Sebastian Trimpe and Dominik Baumann},
journal= {arXiv preprint arXiv:2201.09562},
year = {2023}
}