梦想与搜索以控制:面向连续控制的潜空间规划
机器学习
2020-10-21 v1 人工智能
摘要
利用潜空间动力学进行学习与规划已被证明对基于模型的强化学习(MBRL)中离散与连续控制任务的样本效率有益。特别地,近期针对离散动作空间的工作展示了通过蒙特卡洛树搜索(MCTS)进行潜空间规划以在训练与测试时引导 MBRL 的有效性。然而,潜空间树搜索的潜在增益尚未在具有连续动作空间的环境中得到证明。在本工作中,我们提出并探索了一种基于所学潜动力学上树状规划的连续动作空间 MBRL 方法。我们表明有可能展示出先前针对离散空间所显示的此类引导增益。特别地,与最先进水平相比,该方法在多数具有挑战性的连续控制基准上实现了改进的样本效率与性能。
引用
@article{arxiv.2010.09832,
title = {Dream and Search to Control: Latent Space Planning for Continuous Control},
author = {Anurag Koul and Varun V. Kumar and Alan Fern and Somdeb Majumdar},
journal= {arXiv preprint arXiv:2010.09832},
year = {2020}
}
备注
Preprint