中文

扩散遍历控制的相对值迭代算法的指数收敛速率

最优化与控制 2026-06-30 v1

摘要

本文研究了在一致指数稳定性条件下,Rd\mathbb{R}^d 中扩散在传统遍历代价(CEC)和遍历风险敏感代价(ERSC)准则下的相对值迭代(RVI)算法的收敛速率。现有的 CEC 和 ERSC 问题的 RVI 算法求解相关的初值 Hamilton-Jacobi-Bellman 型方程,其解被证明渐近收敛到相应的最优值。然而,此类算法的收敛速率问题仍然悬而未决。本文基于对相关 PDE 的轻微修改,提出了 RVI 算法的离散时间实现,并证明了这些 RVI 算法在加权上确界范数下的收敛速率是指数的。这些实现具有可显式表示为递归系统的离散时间迭代。在 CEC 情形下,这些迭代与期望值函数之间的差异可以用相关的 Markov 核表示。类似地,在 ERSC 情形下,相应迭代的对数与期望值函数之间的差异也可以用扩展扩散的相关 Markov 核表示。因此,我们能够利用加权半范数(其中 Markov 核作为压缩算子)来证明所需的压缩性质,从而建立指数收敛速率。

关键词

引用

@article{arxiv.2606.31431,
  title  = {Exponential rate of convergence of relative value iteration algorithms for ergodic controls of diffusions},
  author = {Sumith Reddy Anugu and Guodong Pang},
  journal= {arXiv preprint arXiv:2606.31431},
  year   = {2026}
}

备注

This manuscript is 35 pages in length