中文

无限时沃尔科斯折扣与平均成本控制扩散过程的离散时间近似

最优化与控制 2025-02-11 v1

摘要

我们提出对控制扩散过程的无限时沃尔科斯折扣/ergodic 控制问题的最优控制策略的离散时间近似。在此,目标是表明针对离散时间受控马尔可夫链模型设计的最优策略,在采样周期趋于零时,对真实的受控扩散模型具有近似最优性。为此,我们首先构建适当的离散时间受控马尔可夫链模型,通过多种方法(如价值迭代、凸分析方法、强化学习等)可计算其最优策略和最优值。然后,我们采用弱收敛技术,表明离散时间马尔可夫链模型设计的最优策略在离散时间模型趋近于连续时间模型时,对受控扩散模型具有近似最优性。这为寻找受控扩散过程的近似最优控制策略提供了实用方法。我们的条件补充了文献中已有结果,这些结果通过概率方法或 PDE 方法得出。

关键词

引用

@article{arxiv.2502.05596,
  title  = {Discrete-Time Approximations of Controlled Diffusions with Infinite Horizon Discounted and Average Cost},
  author = {Somnath Pradhan and Serdar Yuksel},
  journal= {arXiv preprint arXiv:2502.05596},
  year   = {2025}
}

备注

23