《用于 LQR 设计的原始-对偶 Q-Learning 框架》的补充材料
最优化与控制
2018-11-22 v1
摘要
近来,由于强化学习(RL)在某些挑战性任务中展现出超越人类表现的成果,其受到越来越多的关注。在我们近期的论文“用于 LQR 设计的原始-对偶 Q-learning 框架”中,我们通过拉格朗日对偶理论研究线性二次调节器(LQR)问题的新优化表述,以为潜在有效的 RL 算法奠定理论基础。该新优化问题包含 Q-函数参数,从而可直接用于开发 Q-learning 算法——已知其是最流行的 RL 算法之一。文中我们证明了拉格朗日函数的鞍点与 Bellman 方程最优解之间的关系。作为应用,我们提出了一种无模型的原始-对偶 Q-learning 算法来求解 LQR 问题,并通过示例验证了其有效性。考虑所提分析的其他潜在应用是有意义的。可导出论文中问题 5 或问题 2 的多种 SDP 表述,它们可用于开发新的分析与控制设计方法。例如,可导出基于 SDP 的带能量与输入约束的最优控制设计。另一方向是针对结构化控制器设计的算法。这些方法包含在本补充材料中。
引用
@article{arxiv.1811.08475,
title = {Supplemental Material For "Primal-Dual Q-Learning Framework for LQR Design"},
author = {Donghwan Lee and Jianghai Hu},
journal= {arXiv preprint arXiv:1811.08475},
year = {2018}
}