用于高效无模型强化学习的基于模型的值估计
机器学习
2018-03-02 v1 人工智能
机器学习
摘要
近期的无模型强化学习算法提出将学到的动力学模型作为额外数据来源,以期降低样本复杂度。此类方法有望结合想象数据与模型不确定性概念来加速连续控制任务的学习。遗憾的是,它们依赖于限制动力学模型使用的启发式方法。我们提出基于模型的值扩展,其通过仅允许固定深度的想象来控制模型中的不确定性。通过在无模型强化学习算法中更广泛地使用学到的动力学模型,我们改进了值估计,进而降低了学习的样本复杂度。
引用
@article{arxiv.1803.00101,
title = {Model-Based Value Estimation for Efficient Model-Free Reinforcement Learning},
author = {Vladimir Feinberg and Alvin Wan and Ion Stoica and Michael I. Jordan and Joseph E. Gonzalez and Sergey Levine},
journal= {arXiv preprint arXiv:1803.00101},
year = {2018}
}