ZSL-RPPO:使用循环近端策略优化在复杂地形中实现四足运动的零样本学习
机器人学
2024-03-05 v1
摘要
我们提出了 ZSL-RPPO,这是一种改进的零样本学习架构,它克服了师生神经网络的局限性,能够在复杂地形中为四足机器人生成稳健、可靠且通用的运动。我们提出了一种新算法 RPPO(Recurrent Proximal Policy Optimization,循环近端策略优化),该算法在部分可观测环境中直接训练循环神经网络,并通过域随机化实现更稳健的训练。我们的运动控制器支持在仿真到现实迁移过程中对内在和外在物理参数进行广泛扰动,且无需进一步微调。这可以避免学生模型在仿真到现实迁移过程中性能的显著下降,从而增强运动控制器的稳健性和泛化能力。我们在真实环境中将控制器部署在 Unitree A1 和 Aliengo 机器人上,外部感知由固态激光雷达或深度相机提供。我们的运动控制器在各种复杂地形(如湿滑表面、草地和楼梯)中进行了测试。我们的实验结果和比较表明,我们的方法显著优于现有技术。
引用
@article{arxiv.2403.01928,
title = {ZSL-RPPO: Zero-Shot Learning for Quadrupedal Locomotion in Challenging Terrains using Recurrent Proximal Policy Optimization},
author = {Yao Zhao and Tao Wu and Yijie Zhu and Xiang Lu and Jun Wang and Haitham Bou-Ammar and Xinyu Zhang and Peng Du},
journal= {arXiv preprint arXiv:2403.01928},
year = {2024}
}