中文

SPiDR:一种用于 Sim-to-Real 迁移中零样本安全的简单方法

机器人学 2025-10-23 v4 人工智能

摘要

在现实世界中安全地部署强化学习(RL)具有挑战性,因为在模拟器中训练的策略必须面对不可避免的 sim-to-real 差距。鲁棒的安全 RL 技术具有可证明的安全性,但难以扩展;而域随机化虽更具实用性,却容易产生不安全行为。我们通过提出 SPiDR(Sim-to-real via Pessimistic Domain Randomization 的缩写)来解决这一差距——这是一种具有可证明保证的可扩展算法,用于安全的 sim-to-real 迁移。SPiDR 利用域随机化将 sim-to-real 差距的不确定性纳入安全约束中,使其具有通用性并与现有训练流水线高度兼容。通过在 sim-to-sim 基准测试和两个不同的真实世界机器人平台上进行的大量实验,我们证明了 SPiDR 能够在存在 sim-to-real 差距的情况下有效确保安全,同时保持良好的性能。

关键词

引用

@article{arxiv.2509.18648,
  title  = {SPiDR: A Simple Approach for Zero-Shot Safety in Sim-to-Real Transfer},
  author = {Yarden As and Chengrui Qu and Benjamin Unger and Dongho Kang and Max van der Hart and Laixi Shi and Stelian Coros and Adam Wierman and Andreas Krause},
  journal= {arXiv preprint arXiv:2509.18648},
  year   = {2025}
}