中文

基于零阶估计的模型无关元策略优化:线性二次调节器视角

系统与控制 2025-03-04 v1 系统与控制

摘要

元学习近年来被提出为一个有前景的机器学习主题,在图像分类、机器人、计算机游戏和控制系统等领域有重要应用。在本文中,我们研究了利用元学习来处理遍历线性二次调节器中不确定性和异质性的问题。我们将零阶优化技术与典型的元学习方法相结合,提出了一种省略策略Hessian估计的算法,该算法适用于学习一组异质但相似的线性动态系统。当线性动态系统集合可元学习时,所诱导的元目标函数继承了原始代价函数的重要性质,使得算法可以在可学习的地形上优化而无需投影到可行集上。通过分析元目标函数的梯度有界性和局部平滑性,我们为精确梯度下降过程提供了稳定性和收敛性保证,这些结果验证了所提算法在梯度估计误差较小时的有效性。我们为这些理论保证提供了样本复杂度条件,并在最后提供了一个数值例子以佐证这一视角。

关键词

引用

@article{arxiv.2503.00385,
  title  = {Model-Agnostic Meta-Policy Optimization via Zeroth-Order Estimation: A Linear Quadratic Regulator Perspective},
  author = {Yunian Pan and Tao Li and Quanyan Zhu},
  journal= {arXiv preprint arXiv:2503.00385},
  year   = {2025}
}