中文

基于仿真器的连续深度Q学习用于不确定离散时间系统的镇定

机器学习 2021-04-20 v2 系统与控制 系统与控制 机器学习

摘要

强化学习(RL)在真实系统镇定问题中的应用受到限制,因为智能体需要大量经验来学习最优策略,并且可能在探索过程中采取危险动作。如果我们知道真实系统的数学模型,仿真器是有用的,因为它利用带有给定系统参数向量的数学模型来预测真实系统的行为。我们可以比与真实系统交互更高效地收集大量经验。然而,准确辨识系统参数向量是困难的。如果存在辨识误差,由仿真器获得的经验可能会降低所学策略的性能。因此,我们提出一种实用的RL算法,该算法由两个阶段组成。在第一阶段,我们选择多个系统参数向量。然后,我们为每个系统参数向量建立一个数学模型,称为虚拟系统。我们使用连续深度Q学习算法获得多个虚拟系统的最优Q函数。在第二阶段,我们用一个线性近似函数表示真实系统的Q函数,其基函数为第一阶段学到的最优Q函数。智能体通过在线与真实系统交互来学习该Q函数。通过数值仿真,我们展示了所提方法的实用性。

关键词

引用

@article{arxiv.2101.05640,
  title  = {Continuous Deep Q-Learning with Simulator for Stabilization of Uncertain Discrete-Time Systems},
  author = {Junya Ikemoto and Toshimitsu Ushio},
  journal= {arXiv preprint arXiv:2101.05640},
  year   = {2021}
}