基于动态滤波器输出估计的全局收敛策略搜索
最优化与控制
2022-03-01 v2 数据结构与算法
机器学习
机器学习
摘要
我们引入了首个直接策略搜索算法,该算法可证明收敛到给定含噪部分观测的线性动力学系统输出预测这一经典问题的全局最优滤波器。尽管部分可观测性在实践中无处不在,但作为现代强化学习支柱之一的直接策略搜索算法的理论保证一直难以实现。这主要源于在优化维持内部状态的滤波器时所出现的退化现象。在本文中,我们基于这一概念对此难题提供了新视角,其直观要求是滤波器的所有内部状态分量都能代表底层动力学系统的真实状态。我们表明可信息性克服了上述退化。具体而言,我们提出一个显式强制可信息性的,并确立在该正则化目标上结合“重条件化步骤”的梯度下降以 的速率收敛到全局最优代价。我们的分析依赖于若干可能具有独立意义的新结果,包括通过凸重构分析非凸梯度下降的新框架,以及用(我们对)可信息性(的定量度量)表示的线性 Lyapunov 方程解的新界。
引用
@article{arxiv.2202.11659,
title = {Globally Convergent Policy Search over Dynamic Filters for Output Estimation},
author = {Jack Umenberger and Max Simchowitz and Juan C. Perdomo and Kaiqing Zhang and Russ Tedrake},
journal= {arXiv preprint arXiv:2202.11659},
year = {2022}
}