基于模型与无模型方法在线性二次调节器上的差距:一种渐近视角
机器学习
2019-02-05 v2 最优化与控制
机器学习
摘要
基于模型与无模型方法的有效性是强化学习(RL)中一个长期存在的问题。受近期RL在连续控制任务上经验成功的启发,我们研究了流行的基于模型与无模型算法在线性二次调节器(LQR)上的样本复杂度。我们表明,对于策略评估,一种简单的基于模型插入式方法达到相同解质量所需的样本渐近地少于经典的最小二乘时序差分(LSTD)估计器;两种方法之间的样本复杂度差距至少可达状态维度的倍数。对于策略评估,我们研究了一类简单的问题实例,并表明在这些实例上,名义(等价确定性原则)控制达到相同控制性能水平所需的样本也比策略梯度方法少若干倍的状态与输入维度。此外,即便采用常用的基线,该差距依然存在。据我们所知,这是首个在连续控制任务上证明基于模型与无模型方法之间样本复杂度分离的理论结果。
引用
@article{arxiv.1812.03565,
title = {The Gap Between Model-Based and Model-Free Methods on the Linear Quadratic Regulator: An Asymptotic Viewpoint},
author = {Stephen Tu and Benjamin Recht},
journal= {arXiv preprint arXiv:1812.03565},
year = {2019}
}
备注
Improved the main result regarding policy optimization