动作空间中的探索
机器学习
2020-04-02 v1 机器学习
摘要
近年来,基于黑盒优化的参数空间探索方法被证明在连续控制强化学习领域优于最先进的方法。在本文中,我们考察了这些方法表现更优的原因,以及它们劣于传统动作空间探索方法的情况。通过一个简单的理论分析,我们表明当解决强化学习问题所需的参数复杂度大于动作空间维度和 horizon 长度的乘积时,偏好于动作空间中的探索。通过在几个玩具问题上比较简单的探索方法,这一点也得到了经验上的证实。
引用
@article{arxiv.2004.00500,
title = {Exploration in Action Space},
author = {Anirudh Vemula and Wen Sun and J. Andrew Bagnell},
journal= {arXiv preprint arXiv:2004.00500},
year = {2020}
}
备注
Presented at RSS 2018 in Learning and Inference in Robotics: Integrating Structure, Priors and Models workshop. arXiv admin note: text overlap with arXiv:1901.11503