SoloParkour:基于受限强化学习的视觉 locomotion 徘徊路径规划
机器人学
2024-09-23 v1 计算机视觉与模式识别
机器学习
摘要
徘徊路径规划对四足机器人构成重大挑战,要求其基于有限的感知输入,在复杂环境中实现敏捷且精确的导航。本文提出一种新方法,用于训练从深度图像到机器人控制指令的端到端视觉策略,以实现徘徊路径规划中四足机器人的敏捷安全运动。我们将机器人徘徊路径规划建模为受限强化学习(RL)问题,旨在在机器人物理限制内最大化敏捷技能的涌现,同时确保安全性。首先,我们使用关于机器人周围环境的特权信息训练策略。随后,我们利用该特权策略生成的经验,来热启动基于深度图像的样本高效离策略 RL 算法。这使得机器人能够从特权经验中迁移行为,以实现视觉 locomotion,同时规避了直接从像素进行 RL 的高计算成本。我们在真实的 Solo-12 机器人上验证了该方法的有效性,展示了其执行各种徘徊路径规划技能(如行走、攀爬、跃落和爬行)的能力。
关键词
引用
@article{arxiv.2409.13678,
title = {SoloParkour: Constrained Reinforcement Learning for Visual Locomotion from Privileged Experience},
author = {Elliot Chane-Sane and Joseph Amigo and Thomas Flayols and Ludovic Righetti and Nicolas Mansard},
journal= {arXiv preprint arXiv:2409.13678},
year = {2024}
}
备注
CoRL 2024. Project website: https://gepetto.github.io/SoloParkour/