元学习线性二次型调节器:一种用于无模型LQR的策略梯度MAML方法
最优化与控制
2024-06-04 v2 机器学习
摘要
我们研究了在多任务、异构且无模型的环境下学习线性二次型调节器(LQR)的问题。我们刻画了基于策略梯度(PG)的模型无关元学习(MAML)(Finn et al., 2017)方法在不同任务异质性设置下解决LQR问题的稳定性和个性化保证。我们证明,我们的MAML-LQR算法在基于模型和无模型的学习场景中,都能产生一个接近每个任务特定最优控制器的稳定控制器,其误差受任务异质性偏差影响。此外,在基于模型的设置中,我们证明该控制器以线性收敛速率实现,这优于现有工作中的次线性速率。我们的理论保证表明,学习到的控制器能够高效地适应未见过的LQR任务。
引用
@article{arxiv.2401.14534,
title = {Meta-Learning Linear Quadratic Regulators: A Policy Gradient MAML Approach for Model-free LQR},
author = {Leonardo F. Toso and Donglin Zhan and James Anderson and Han Wang},
journal= {arXiv preprint arXiv:2401.14534},
year = {2024}
}