博弈安全滤波器:通过对抗想象实现鲁棒的零样本安全
机器人学
2025-01-17 v4 机器学习
摘要
尽管基于学习的机器人控制近期取得了令人瞩目的进展,但确保对分布外条件的鲁棒性仍然是一个悬而未决的挑战。安全滤波器原则上可以通过覆盖不安全的动作来防止任意控制策略发生灾难性故障,但针对复杂(例如有腿)机器人动力学的现有解决方案并未覆盖完整的运动包络,而是依赖于局部的降阶模型。这些滤波器往往会过度限制敏捷性,并且在受到扰动偏离标称条件时仍可能失效。本文提出了博弈安全滤波器,这是一类新型预测性安全滤波器,它不断在其仿真训练的安全策略与一个被协同训练以引发最坏情况事件和 sim-to-real 误差的虚拟对手之间推演假想的对抗博弈,并阻止会导致后续失败的动作。我们通过首个适用于(36 维)四足动力学的全阶安全滤波器展示了该方法的可扩展性和鲁棒性。在两个不同四足平台上进行的物理实验表明,博弈安全滤波器在受到拖拽和未建模地形等大扰动时具有卓越的零样本有效性。实验视频和开源软件可在线获取:https://saferobotics.org/research/gameplay-filter
引用
@article{arxiv.2405.00846,
title = {Gameplay Filters: Robust Zero-Shot Safety through Adversarial Imagination},
author = {Duy P. Nguyen and Kai-Chieh Hsu and Wenhao Yu and Jie Tan and Jaime F. Fisac},
journal= {arXiv preprint arXiv:2405.00846},
year = {2025}
}