从强化学习与原始对偶优化视角看随机LQR控制器的无模型设计
系统与控制
2021-03-18 v1 系统与控制
摘要
为了进一步理解各类强化学习(RL)算法的内在机制,并更好地利用优化理论推动RL的进一步发展,许多研究者开始重新审视线性二次调节器(LQR)问题,该问题设定简单却能刻画RL的特征。受此启发,本文从RL与原始对偶优化两个视角,研究受高斯噪声影响的线性系统之随机LQR控制器的无模型设计。从RL视角出发,我们首先提出一种新的无模型离策策略迭代(MF-OPPI)算法,其中采样数据被重复使用以更新策略,从而在一定程度上缓解数据饥渴问题。随后我们通过证明所涉及的迭代等价于经典策略迭代(PI)算法中的迭代,给出了算法收敛性的严格分析。从优化视角出发,我们首先将手头的随机LQR问题重新表述为一个约束非凸优化问题,并证明其具有强对偶性。接着,为求解该非凸优化问题,我们基于所得Karush-Kuhn-Tucker(KKT)条件的性质,提出一种基于模型的原始对偶(MB-PD)算法。我们还通过求解一个变换后的对偶可行性条件,给出了MB-PD算法的无模型实现。更重要的是,我们指出MB-PD算法中的对偶更新与原始更新步骤可分别解释为PI算法中的策略评估与策略改进步骤。最后,我们给出一个仿真例子以展示所提算法的性能。
引用
@article{arxiv.2103.09407,
title = {Model-Free Design of Stochastic LQR Controller from Reinforcement Learning and Primal-Dual Optimization Perspective},
author = {Man Li and Jiahu Qin and Wei Xing Zheng and Yaonan Wang and Yu Kang},
journal= {arXiv preprint arXiv:2103.09407},
year = {2021}
}