基于深度强化学习的 quadruped 机器人鲁棒高速奔跑
机器人学
2023-03-16 v2 机器学习
系统与控制
系统与控制
摘要
深度强化学习已成为开发 quadruped 机器人运动控制器的流行且强大的方法。常见方法主要集中于直接在关节空间学习动作,或学习修改并偏移由轨迹生成器产生的足端位置。两种方法通常都需要细致的奖励塑形与数百万时间步的训练,且轨迹生成器会给所得控制策略引入人为偏差。本文提出一种学习框架,可自然涌现出快速且鲁棒的 quadruped 机器人跳跃(bounding)策略。智能体直接在任务空间中选择并控制动作,以在包含模型不确定性与粗糙地形等环境噪声下跟踪期望速度指令。我们观察到该框架提高了样本效率,几乎不需要奖励塑形,自然涌现出如疾驰(galloping)与跳跃(bounding)等步态,并简化了奔跑速度下的 sim-to-real 迁移。即便在超过 100% 标称 quadruped 质量的负载下穿越粗糙地形这一困难任务中,策略也仅需数百万时间步即可学会。训练在 PyBullet 中进行,我们进行了到 Gazebo 的 sim-to-sim 迁移以及到 Unitree A1 硬件的 sim-to-real 迁移。对于 sim-to-sim,结果显示 quadruped 在无负载时可跑过 4 m/s,在 10 kg 负载(超过标称 quadruped 质量的 83%)下可达 3.5 m/s。对于 sim-to-real,Unitree A1 可在 5 kg 负载(占标称 quadruped 质量的 42%)下以 2 m/s 跳跃(bound)。
引用
@article{arxiv.2103.06484,
title = {Robust High-speed Running for Quadruped Robots via Deep Reinforcement Learning},
author = {Guillaume Bellegarda and Yiyu Chen and Zhuochen Liu and Quan Nguyen},
journal= {arXiv preprint arXiv:2103.06484},
year = {2023}
}