参数空间与动作空间探索的对比:零阶优化视角
机器学习
2019-02-01 v1 人工智能
机器人学
机器学习
摘要
在参数空间中探索的黑盒优化器常被证明优于专门针对强化学习问题开发的更复杂的动作空间探索方法。我们仔细考察这些黑盒方法,以识别它们劣于动作空间探索方法的情形以及它们占优的情形。通过简单的理论分析,我们证明参数空间探索的复杂度取决于参数空间的维数,而动作空间探索的复杂度同时取决于动作空间的维数与时域长度。通过在若干模型问题(包括上下文_bandit、线性回归和连续控制中的强化学习)上比较简单的探索方法,这一点也得到了实证展示。
引用
@article{arxiv.1901.11503,
title = {Contrasting Exploration in Parameter and Action Space: A Zeroth-Order Optimization Perspective},
author = {Anirudh Vemula and Wen Sun and J. Andrew Bagnell},
journal= {arXiv preprint arXiv:1901.11503},
year = {2019}
}
备注
Accepted at AISTATS 2019