DecAP:用于加速基于力矩的腿式运动策略模仿学习的衰减动作先验
摘要
得益于柔顺且鲁棒的特性,腿式机器人的最优控制已从基于位置的控制范式转向基于力矩的控制。与此转变并行,学界也将深度强化学习(DRL)视为直接学习复杂现实任务运动策略的一种有前景的方法。然而,大多数端到端DRL方法仍在位置空间中运行,主要因为力矩空间中的学习往往样本效率低且不能稳定收敛到自然步态。为应对这些挑战,我们提出一个两阶段框架。第一阶段,我们通过训练基于位置的策略来生成自身的模仿数据,从而无需专家知识来设计最优控制器。第二阶段引入衰减动作先验,一种借助模仿奖励增强基于力矩的策略探索的新方法。我们表明,该方法始终优于单独的模仿学习,并且对这些奖励从0.1倍到10倍的缩放具有鲁棒性。我们进一步通过在四足机器人(Unitree Go1)上比较基于位置的策略与位置辅助的基于力矩的策略的鲁棒性,验证了力矩控制的优势,训练时未采用任何外部扰动形式的域随机化。
引用
@article{arxiv.2310.05714,
title = {DecAP: Decaying Action Priors for Accelerated Imitation Learning of Torque-Based Legged Locomotion Policies},
author = {Shivam Sood and Ge Sun and Peizhuo Li and Guillaume Sartoretti},
journal= {arXiv preprint arXiv:2310.05714},
year = {2024}
}
备注
\c{opyright} 20XX IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works