中文

数据驱动的动态多目标最优控制:一种满意强化学习方法

系统与控制 2021-01-26 v4 系统与控制 最优化与控制

摘要

本文提出一种迭代数据驱动算法,用于求解非线性连续时间系统控制中出现的动态多目标(MO)最优控制问题。首先证明,与每个目标对应的哈密顿泛函可用于比较可行策略的性能。随后利用哈密顿不等式,其满足可保证满足各目标的期望水平。接着提出一种满意动态优化框架,在优化主要目标的同时满足其他目标的期望。揭示了其与满意(足够好)决策框架的关系。开发了基于平方和(SOS)的迭代算法来求解所表述的满意多目标优化。为免除对系统动力学完整知识的要求,提出一种数据驱动满意强化学习方法,仅利用一段时间内测量的系统轨迹信息,在无需系统动力学完整知识的情况下实时求解 SOS 优化问题。最后,给出两个仿真示例以证明所提算法的有效性。

关键词

引用

@article{arxiv.2005.07118,
  title  = {Data-driven Dynamic Multi-objective Optimal Control: An Aspiration-satisfying Reinforcement Learning Approach},
  author = {Majid Mazouchi and Yongliang Yang and Hamidreza Modares},
  journal= {arXiv preprint arXiv:2005.07118},
  year   = {2021}
}