中文

基于李雅普诺夫的强化学习状态估计器

机器学习 2021-01-08 v2 机器人学 系统与控制 系统与控制

摘要

本文中,我们考虑非线性随机离散时间系统的状态估计问题。我们结合控制理论中的李雅普诺夫方法与深度强化学习来设计状态估计器。我们仅利用从模型模拟的数据,从理论上证明了有界估计误差的收敛性。提出了一种actor-critic强化学习算法来学习由深度神经网络逼近的状态估计器。分析了该算法的收敛性。所提出的基于李雅普诺夫的强化学习状态估计器通过蒙特卡洛仿真与若干现有非线性滤波方法进行比较,显示出即使在系统噪声协方差偏移和随机丢失测量等某些系统不确定性下,其在估计收敛性方面的优势。据我们所知,这是首个具有有界估计误差性能保证的基于强化学习的非线性状态估计器。

关键词

引用

@article{arxiv.2010.13529,
  title  = {Lyapunov-Based Reinforcement Learning State Estimator},
  author = {Liang Hu and Chengwei Wu and Wei Pan},
  journal= {arXiv preprint arXiv:2010.13529},
  year   = {2021}
}