面向线性二次调节器的结构化策略迭代
人工智能
2020-07-14 v1 最优化与控制
摘要
线性二次调节器(LQR)是解决连续马尔可夫决策过程任务最流行的框架之一。凭借其基础理论与易处理的最优策略,近年来 LQR 在强化学习场景(如免模型或基于模型的设定)下被重新审视与分析。本文中,我们为 LQR 引入结构化策略迭代(S-PI),一种能够导出结构化线性策略的方法。此类具有(块)稀疏性或低秩的结构化策略相比标准 LQR 策略具有显著优势:更具可解释性、内存高效且适用于分布式设定。为导出此类策略,我们首先在模型已知时构造一个正则化 LQR 问题。随后,我们的结构化策略迭代(S-PI)算法以迭代方式执行策略评估步与策略改进步,可高效求解该正则化 LQR。我们进一步将 S-PI 算法推广至免模型设定,其中采用平滑过程估计梯度。在模型已知与免模型两种设定下,我们在恰当选取参数后给出了收敛性分析。最后,实验展示了 S-PI 在通过调节权重参数权衡 LQR 性能与结构程度方面的优势。
引用
@article{arxiv.2007.06202,
title = {Structured Policy Iteration for Linear Quadratic Regulator},
author = {Youngsuk Park and Ryan A. Rossi and Zheng Wen and Gang Wu and Handong Zhao},
journal= {arXiv preprint arXiv:2007.06202},
year = {2020}
}