Spot 上的高性能强化学习:利用分布性度量优化仿真参数
机器学习
2025-07-04 v3 机器人学
摘要
本工作概述了在Boston Dynamics Spot硬件上部署高性能强化学习策略的技术细节,涉及低层马达访问。这是首次公开展示在Spot硬件上部署端到端强化学习策略,且训练代码通过Nvidia IsaacLab公开,部署代码通过Boston Dynamics公开。我们利用Wasserstein距离和最大均值偏差来量化硬件上收集的数据与仿真数据之间的分布差异,用以衡量我们的sim2real 差距。我们将这些度量作为协方差矩阵自适应进化策略的评分函数,用于优化Spot上不易测量或未知的仿真参数。我们的方法能产生质量较高的强化学习策略,能够实现多种步态,包括飞行相。我们部署的策略实现了超过5.2ms的 locomotion,速度是Spot默认控制器的最大速度的三倍以上,对滑溜表面的鲁棒性、干扰抑制以及整体灵活性在Spot上前所未有。我们详细阐述了方法并发布代码以支持未来在Spot上使用低级API的工作。
引用
@article{arxiv.2504.17857,
title = {High-Performance Reinforcement Learning on Spot: Optimizing Simulation Parameters with Distributional Measures},
author = {AJ Miller and Fangzhou Yu and Michael Brauckmann and Farbod Farshidian},
journal= {arXiv preprint arXiv:2504.17857},
year = {2025}
}