面向定向折扣 Hamilton--Jacobi--Bellman 方程的策略迭代:一种粘性解方法
最优化与控制
2026-04-14 v1 数值分析
数值分析
摘要
我们研究针对确定性无限时刻折扣最优控制问题的策略迭代(PI),其价值函数由固定的 Hamilton--Jacobi--Bellman(HJB)方程刻画。在偏微分方程层面,PI 本质上是病态的:提高步骤需要对 进行逐点求值,而粘性解此类梯度并不well定义,从而导致关联的非线性算子无法以稳定的函数意义下解释。我们通过引入 人工粘性项的空间离散方案,构建了针对定性折扣情形的单调半离散格式。这种正则化恢复了比较性,确保离散算子的单调性,并通过离散梯度实现良定义的逐点策略改进。我们的分析揭示了与有限时刻情形截然不同的收敛机制。对于每个固定的网格大小 ,我们证明了半离散 PI 序列单调收敛并呈指数收敛于唯一的离散解,其中收缩源于折扣算子 resolvent 结构。我们进一步建立了尖锐的消失粘性估计 ,并推导了量化误差分解,区分策略迭代误差与离散化误差,显示迭代次数与网格大小之间存在非平凡的耦合。数值实验在非线性的一维和二维控制问题中验证了理论预测,包括指数收敛和总误差特征的衰减后平台行为。
引用
@article{arxiv.2604.10191,
title = {Policy Iteration for Stationary Discounted Hamilton--Jacobi--Bellman Equations: A Viscosity Approach},
author = {Namkyeong Cho and Yeoneung Kim},
journal= {arXiv preprint arXiv:2604.10191},
year = {2026}
}