中文

准随机逼近的马尔可夫基础及其在极值搜索控制中的应用

最优化与控制 2024-04-02 v4

摘要

本文关注准随机逼近(QSA)以解决在优化与强化学习应用中常见的根寻找问题。一般的常增益算法可表示为时间非齐次 ODE ddtΘt=αft(Θt) \frac{d}{dt}\Theta_t=\alpha f_t (\Theta_t),其中状态过程 Θ\ThetaRd\mathbb{R}^d 上演化。理论基于几乎周期向量场,从而特别地,ft(θ)f_t(\theta) 的时间平均定义了时间齐次平均向量场 fˉ ⁣:RdRd\bar{f} \colon \mathbb{R}^d \to \mathbb{R}^d,满足 fˉ(θ)=0\bar{f}(\theta^*)=0。在对所涉及函数的光滑性假设下,得到如下精确表示:ddtΘt=α[fˉ(Θt)αΥˉt+α2Wt0+αddtWt1+d2dt2Wt2]\frac{d}{dt}\Theta_t=\alpha[\bar{f}(\Theta_t)-\alpha\bar\Upsilon_t+\alpha^2\mathcal{W}_t^0+\alpha\frac{d}{dt}\mathcal{W}_t^1+\frac{d^2}{dt^2}\mathcal{W}_t^2]以及光滑信号 {Υˉt,Wti:i=0,1,2}\{\bar \Upsilon_t , \mathcal{W}_t^i : i=0, 1, 2\} 的公式。这一新表示,结合关于最终有界性的新条件,对推进 QSA 理论及其应用有许多用途,包括本文发展的以下推论:(i) 证明估计误差 Θtθ\|\Theta_t-\theta^*\|O(α)O(\alpha) 阶,但可用二阶线性滤波器降至 O(α2)O(\alpha^2)。(ii) 在极值搜索控制应用中,发现标准算法因非 Lipschitz 连续而不适用该结果。我们提出一种新方法来确保所需 Lipschitz 界成立,并由此获得稳定性、瞬态界、以及 O(α2)O(\alpha^2) 阶的渐近偏置和 O(α4)O(\alpha^4) 阶的渐近方差。(iii) 当存在马尔可夫噪声时,一般在传统随机逼近中也可能获得优于 O(α)O(\alpha) 的误差界。

关键词

引用

@article{arxiv.2207.06371,
  title  = {Markovian Foundations for Quasi-Stochastic Approximation with Applications to Extremum Seeking Control},
  author = {Caio Kalil Lauand and Sean Meyn},
  journal= {arXiv preprint arXiv:2207.06371},
  year   = {2024}
}

备注

53 pages, 15 Figures