用于非线性连续时间最优控制设计的基于数据的近似策略迭代
系统与控制
2013-11-20 v1 最优化与控制
机器学习
摘要
本文针对具有广义代价函数的无模型非线性最优问题,开发了一种基于数据的强化学习技术。众所周知,非线性最优控制问题依赖于 Hamilton-Jacobi-Bellman (HJB) 方程的解,这是一个通常无法解析求解的非线性偏微分方程。更糟糕的是,大多数实际系统过于复杂,难以建立其精确的数学模型。为了克服这些困难,我们提出了一种基于数据的近似策略迭代 (API) 方法,利用真实系统数据而非系统模型。首先,推导了用于约束最优控制问题的无模型策略迭代算法并证明了其收敛性,该算法可以在不需要任何系统数学模型知识的情况下学习 HJB 方程的解和最优控制策略。算法的实现基于 Actor-Critic 结构思想,其中 Actor 和 Critic 神经网络 (NNs) 分别用于逼近控制策略和代价函数。为了更新 Actor 和 Critic NNs 的权重,基于加权残差法开发了一种最小二乘法。整个基于数据的 API 方法包括两部分:第一部分在线实施以收集真实系统信息,第二部分离线进行策略迭代以学习 HJB 方程的解和控制策略。然后,简化了基于数据的 API 算法以求解非线性和线性系统的无约束最优控制问题。最后,我们在一个简单的非线性系统上测试了基于数据的 API 控制设计方法的效率,并将其进一步应用于旋转/平移执行器系统。仿真结果证明了所提方法的有效性。
引用
@article{arxiv.1311.0396,
title = {Data-based approximate policy iteration for nonlinear continuous-time optimal control design},
author = {Biao Luo and Huai-Ning Wu and Tingwen Huang and Derong Liu},
journal= {arXiv preprint arXiv:1311.0396},
year = {2013}
}
备注
22 pages, 21 figures, submitted for Peer Review