中文

一种用于 LQR 元策略估计的莫罗包络方法

最优化与控制 2024-10-08 v2 机器学习 系统与控制 系统与控制

摘要

我们研究了离散时间线性时不变不确定动态系统中线性二次型调节器(LQR)的策略估计问题。我们提出了一种基于莫罗包络的替代 LQR 代价函数,该函数由不确定系统的有限个实现集合构建,以定义一个能高效适应新实现的元策略。此外,我们设计了一种算法来寻找元 LQR 代价函数的近似一阶驻点。数值结果表明,所提出的方法在线性系统的新实现上优于简单的控制器平均方法。我们还提供了实证证据,表明我们的方法比模型无关元学习(MAML)方法具有更好的样本复杂度。

关键词

引用

@article{arxiv.2403.17364,
  title  = {A Moreau Envelope Approach for LQR Meta-Policy Estimation},
  author = {Ashwin Aravind and Mohammad Taha Toghani and César A. Uribe},
  journal= {arXiv preprint arXiv:2403.17364},
  year   = {2024}
}

备注

Accepted for presentation at Conference on Decision and Control 2024 (CDC'24)