中文

受控扩散中的 Lipschitz 与光滑策略的近最优性

最优化与控制 2024-05-28 v1

摘要

对于扩散过程的最优控制问题,由于计算或分析原因,许多研究预先假设控制策略为Lipschitz 或光滑,通常没有对这种限制是否导致损失进行严格分析。虽然在某些技术条件下,可证明期望有限时域/无限时域(折扣/平稳)成本和成本-退出时间最优控制问题的马尔可夫/平稳马尔可夫策略是最优的,但最优解通常仅在状态(以及有限时域中的时间)上是可测的,没有额外的结构属性。本文建立在我们最近的工作[S. Pradhan和S. Yüksel, 关于受控扩散在Borkar控制拓扑下期望成本连续性及其对离散空间和时间近似的影响, Electronic Journal of Probability (2024)]的基础上,建立了一类扩散过程在Borkar控制拓扑下控制策略空间上最优成本的连续性,进而在期望有限时域、无限时域折扣/平均和退出时间成本准则下,证明了光滑/Lipschitz 连续策略的近最优性。在温和假设下,我们首先表明光滑/Lipschitz 连续策略在Borkar 拓扑下密集于马尔可夫/平稳马尔可夫策略空间中。然后利用Borkar 拓扑下马尔可夫/平稳马尔可夫策略空间中最优成本作为策略函数的连续性,我们证明最优策略可以以任意精度用光滑/Lipschitz 连续策略近似。虽然我们的结果是我们最近工作的延伸,但鉴于光滑和Lipschitz 策略在文献中占据的突出地位,给出关于Lipschitz 和光滑策略的明确表述和易于访问的表述,激励了我们的当前论文。

关键词

引用

@article{arxiv.2405.16223,
  title  = {Near Optimality of Lipschitz and Smooth Policies in Controlled Diffusions},
  author = {Somnath Pradhan and Serdar Yuksel},
  journal= {arXiv preprint arXiv:2405.16223},
  year   = {2024}
}

备注

10 pages. arXiv admin note: substantial text overlap with arXiv:2209.14982