基于概率模型的强化学习合成神经网络控制器
机器人学
2018-08-02 v3 人工智能
摘要
我们提出一种快速学习机器人系统控制器的算法。该算法遵循基于模型的强化学习范式,并改进了现有算法,即控制中的概率学习(PILCO)以及带有神经网络动力学的 PILCO 基于样本的版本(Deep-PILCO)。我们提出使用带截断对数正态噪声的变分 dropout 训练神经网络动力学模型。这使我们能获得具有校准不确定性的动力学模型,可用于通过 rollout 模拟控制器执行。我们还描述了一组受将 PILCO 视为循环神经网络模型启发的技术,它们对改进方法的收敛性至关重要。我们在多种基准任务上测试了我们的方法,展示了与 PILCO 相当的数据效率,同时能够优化复杂的神经网络控制器。最后,我们评估了该算法为六足自主水下航行器学习运动控制器的性能。这展示了该算法在更复杂控制任务中扩展维度和数据集规模的潜力。
引用
@article{arxiv.1803.02291,
title = {Synthesizing Neural Network Controllers with Probabilistic Model based Reinforcement Learning},
author = {Juan Camilo Gamboa Higuera and David Meger and Gregory Dudek},
journal= {arXiv preprint arXiv:1803.02291},
year = {2018}
}
备注
8 pages, 7 figures