中文

用于 $H_\infty$ 控制设计的离策略强化学习

系统与控制 2014-05-13 v3 机器学习 最优化与控制 机器学习

摘要

考虑了具有未知内部系统模型的非线性系统的 HH_\infty 控制设计问题。众所周知,非线性 HH_\infty 控制问题可转化为求解所谓的 Hamilton-Jacobi-Isaacs (HJI) 方程,这是一个通常无法解析求解的非线性偏微分方程。更糟糕的是,当准确的系统模型不可用或在实践中获取成本高昂时,基于模型的方法无法用于近似求解 HJI 方程。为了克服这些困难,引入了一种离策略强化学习 (RL) 方法,从真实系统数据而非数学系统模型中学习 HJI 方程的解,并证明了其收敛性。在离策略 RL 方法中,系统数据可以由任意策略而非评估策略生成,这对于实际系统极其重要且充满希望。为了实现该目的,采用了基于神经网络 (NN) 的 Actor-Critic 结构,并基于加权残差法推导了最小二乘 NN 权重更新算法。最后,开发的基于 NN 的离策略 RL 方法在线性 F16 飞机装置上进行了测试,并进一步应用于旋转/平移执行器系统。

关键词

引用

@article{arxiv.1311.6107,
  title  = {Off-policy reinforcement learning for $ H_\infty $ control design},
  author = {Biao Luo and Huai-Ning Wu and Tingwen Huang},
  journal= {arXiv preprint arXiv:1311.6107},
  year   = {2014}
}

备注

Accepted by IEEE Transactions on Cybernetics. IEEE Transactions on Cybernetics, Online Available, 2014