基于动态镜像下降的模型预测控制用于加速机器人学习
机器人学
2021-12-07 v1
摘要
近期强化学习(RL)工作将无模型(Mf)-RL 算法与基于模型(Mb)-RL 方法结合,以兼得两者优势:Mf-RL 的渐近性能与 Mb-RL 的高样本效率。受这些工作启发,我们提出一种分层框架,将用于 Mb-轨迹优化的在线学习与用于 Mf-RL 的离策略方法相集成。具体地,提出两个循环,其中基于动态镜像下降的模型预测控制(DMD-MPC)用作内环 Mb-RL 以获取最优动作序列。这些动作转而用于显著加速外环 Mf-RL。我们表明我们的公式对一类广泛的基于 MPC 的策略与目标具有通用性,并包含了一些知名的 Mb-Mf 方法。我们最终引入一种新算法:镜像下降模型预测 RL(M-DeMoRL),其内环使用带精英分数的交叉熵方法(CEM)。我们的实验显示了所提分层方法在基准 MuJoCo 任务上的更快收敛。我们还展示了 2R 腿中用于轨迹跟踪的硬件训练,以及四足机器人中用于鲁棒行走的硬件迁移。我们表明内环 Mb-RL 显著减少了真实系统所需的训练迭代次数,从而验证了所提方法。
引用
@article{arxiv.2112.02999,
title = {Dynamic Mirror Descent based Model Predictive Control for Accelerating Robot Learning},
author = {Utkarsh A. Mishra and Soumya R. Samineni and Prakhar Goel and Chandravaran Kunjeti and Himanshu Lodha and Aman Singh and Aditya Sagi and Shalabh Bhatnagar and Shishir Kolathaya},
journal= {arXiv preprint arXiv:2112.02999},
year = {2021}
}
备注
8 pages, 4 figures. arXiv admin note: substantial text overlap with arXiv:2110.12239