关于深度强化学习中神经网络的表达能力
机器学习
2020-09-08 v3 人工智能
机器学习
摘要
我们通过策略、 函数与动力学的神经网络表达能力的视角,比较无模型强化学习与基于模型的方法。我们从理论与经验上表明,即便对于一维连续状态空间,也存在许多最优 函数与策略远比动力学复杂得多的 MDP。我们推测许多真实世界的 MDP 也具有类似性质。对于这些 MDP,基于模型的规划是更优的算法,因为其所得策略能比神经网络参数化更好地逼近最优策略,而无模型或基于模型的策略优化都依赖于策略参数化。受该理论启发,我们应用一种简单的多步基于模型的自举规划器(BOOTS),将一个弱的 函数提升为更强的策略。经验结果表明,在测试时于基于模型或无模型策略优化算法之上应用 BOOTS,可提升在 MuJoCo 基准任务上的性能。
引用
@article{arxiv.1910.05927,
title = {On the Expressivity of Neural Networks for Deep Reinforcement Learning},
author = {Kefan Dong and Yuping Luo and Tengyu Ma},
journal= {arXiv preprint arXiv:1910.05927},
year = {2020}
}
备注
Accepted in ICML 2020. Title of previous version was "Bootstrapping the Expressivity with Model-based Planning". Code is available at https://github.com/roosephu/boots