基于学习动态的数据驱动控制:模型基与无模型方法比较
机器学习
2020-06-18 v1 系统与控制
系统与控制
机器学习
摘要
本文比较了两类代表模型基与无模型方法的数据驱动控制方法。其一为近期提出的方法——用于控制的深度 Koopman 表示(DKRC),它利用深度神经网络将未知非线性动力系统映射至高维线性系统,从而可采用最先进的控制策略。另一类为基于 actor-critic 架构的经典无模型控制方法——深度确定性策略梯度(DDPG),已被证明在多种动力系统中有效。比较在 OpenAI Gym 中进行,其提供多个用于控制基准的环境。给出了两个比较示例,即经典倒立摆与 Lunar Lander 连续控制。根据实验结果,我们从控制策略及不同初始化条件下的有效性方面比较了这两种方法。我们还用由欧拉-拉格朗日线性化方法推导的解析模型检验了 DKRC 学到的动态模型,证明了该数据驱动样本高效方法对未知动态所学模型的准确性。
引用
@article{arxiv.2006.09543,
title = {Data Driven Control with Learned Dynamics: Model-Based versus Model-Free Approach},
author = {Wenjian Hao and Yiqiang Han},
journal= {arXiv preprint arXiv:2006.09543},
year = {2020}
}
备注
17 pages, 16 figures