准随机逼近的马尔可夫基础及其在极值搜索控制中的应用
最优化与控制
2024-04-02 v4
摘要
本文关注准随机逼近(QSA)以解决在优化与强化学习应用中常见的根寻找问题。一般的常增益算法可表示为时间非齐次 ODE ,其中状态过程 在 上演化。理论基于几乎周期向量场,从而特别地, 的时间平均定义了时间齐次平均向量场 ,满足 。在对所涉及函数的光滑性假设下,得到如下精确表示:以及光滑信号 的公式。这一新表示,结合关于最终有界性的新条件,对推进 QSA 理论及其应用有许多用途,包括本文发展的以下推论:(i) 证明估计误差 为 阶,但可用二阶线性滤波器降至 。(ii) 在极值搜索控制应用中,发现标准算法因非 Lipschitz 连续而不适用该结果。我们提出一种新方法来确保所需 Lipschitz 界成立,并由此获得稳定性、瞬态界、以及 阶的渐近偏置和 阶的渐近方差。(iii) 当存在马尔可夫噪声时,一般在传统随机逼近中也可能获得优于 的误差界。
引用
@article{arxiv.2207.06371,
title = {Markovian Foundations for Quasi-Stochastic Approximation with Applications to Extremum Seeking Control},
author = {Caio Kalil Lauand and Sean Meyn},
journal= {arXiv preprint arXiv:2207.06371},
year = {2024}
}
备注
53 pages, 15 Figures