评估基于模型的规划与规划器摊销用于连续控制
机器人学
2021-10-08 v1 人工智能
机器学习
摘要
有一种广泛的直觉认为,基于模型的控制方法应当能够超越无模型方法的数据效率。在本文中,我们试图在各种具有挑战性的运动任务上评估这一直觉。我们采取混合方法,将模型预测控制(MPC)与学习到的模型及无模型策略学习相结合;学习到的策略作为MPC的提议。我们发现,即使对于高自由度控制问题,调优良好的无模型智能体也是强基线,但带有学习提议和模型的MPC(在线训练或从相关任务迁移)能在困难的多任务/多目标设定中显著提升性能与数据效率。最后,我们展示可以将基于模型的规划器蒸馏为一个策略,该策略在不损失任何性能的情况下摊销规划计算。执行不同任务的智能体视频可见 https://sites.google.com/view/mbrl-amortization/home。
引用
@article{arxiv.2110.03363,
title = {Evaluating model-based planning and planner amortization for continuous control},
author = {Arunkumar Byravan and Leonard Hasenclever and Piotr Trochim and Mehdi Mirza and Alessandro Davide Ialongo and Yuval Tassa and Jost Tobias Springenberg and Abbas Abdolmaleki and Nicolas Heess and Josh Merel and Martin Riedmiller},
journal= {arXiv preprint arXiv:2110.03363},
year = {2021}
}
备注
9 pages main text, 30 pages with references and appendix including several ablations and additional experiments. Submitted to ICLR 2022