中文

网络系统中具有结构化反馈的风险约束线性二次调节器的无模型学习

最优化与控制 2022-04-06 v1

摘要

我们为无限时域线性二次调节器(LQR)问题开发了一种无模型学习算法。具体地,我们考虑了(风险)约束与结构化反馈,以在降低状态偏差的同时允许实际中稀疏的通信图。通过将对偶问题重新表述为非凸-凹极小极大问题,我们采用梯度下降最大预言(GDmax),并在无模型设定下使用零阶策略梯度的随机(S)GDmax。通过利用特定定义的子水平集界定 LQR 代价的 Lipschitz 与光滑常数,我们可设计步长与相关参数以建立到驻点的收敛(以高概率)。在网络化微电网控制问题中的数值测试验证了我们所提 SGDmax 算法的收敛性,同时展示了风险约束的有效性。与经典 LQR 控制相比,SGDmax 算法达到了令人满意的最优性间隙,尤其对于全反馈情形。

关键词

引用

@article{arxiv.2204.01779,
  title  = {Model-free Learning for Risk-constrained Linear Quadratic Regulator with Structured Feedback in Networked Systems},
  author = {Kyung-bin Kwon and Lintao Ye and Vijay Gupta and Hao Zhu},
  journal= {arXiv preprint arXiv:2204.01779},
  year   = {2022}
}