中文

面向定向折扣 Hamilton--Jacobi--Bellman 方程的策略迭代:一种粘性解方法

最优化与控制 2026-04-14 v1 数值分析 数值分析

摘要

我们研究针对确定性无限时刻折扣最优控制问题的策略迭代(PI),其价值函数由固定的 Hamilton--Jacobi--Bellman(HJB)方程刻画。在偏微分方程层面,PI 本质上是病态的:提高步骤需要对 V\nabla V 进行逐点求值,而粘性解此类梯度并不well定义,从而导致关联的非线性算子无法以稳定的函数意义下解释。我们通过引入 O(h)O(h) 人工粘性项的空间离散方案,构建了针对定性折扣情形的单调半离散格式。这种正则化恢复了比较性,确保离散算子的单调性,并通过离散梯度实现良定义的逐点策略改进。我们的分析揭示了与有限时刻情形截然不同的收敛机制。对于每个固定的网格大小 h>0h>0,我们证明了半离散 PI 序列单调收敛并呈指数收敛于唯一的离散解,其中收缩源于折扣算子 resolvent 结构。我们进一步建立了尖锐的消失粘性估计 VhVLCh\|V^h - V\|_{L^\infty} \leq C\sqrt{h},并推导了量化误差分解,区分策略迭代误差与离散化误差,显示迭代次数与网格大小之间存在非平凡的耦合。数值实验在非线性的一维和二维控制问题中验证了理论预测,包括指数收敛和总误差特征的衰减后平台行为。

关键词

引用

@article{arxiv.2604.10191,
  title  = {Policy Iteration for Stationary Discounted Hamilton--Jacobi--Bellman Equations: A Viscosity Approach},
  author = {Namkyeong Cho and Yeoneung Kim},
  journal= {arXiv preprint arXiv:2604.10191},
  year   = {2026}
}