中文

霍华德策略迭代的概率框架:BML 评估与鲁棒收敛分析

最优化与控制 2024-10-28 v1

摘要

本文旨在利用正倒向随机微分方程(FBSDEs)的语言为霍华德策略迭代算法构建概率框架。与基于偏微分方程的常规表述不同,我们基于 FBSDE 的表述可通过在样本数据上优化准则轻松实现,因此对状态维度的敏感性较低。具体而言,通过构造不同的 FBSDE,讨论了同策略与离策略评估方法。随后提出倒向可测性损失(BML)准则来求解这些方程。通过在所提准则中选择特定的权函数,我们可以恢复流行的 Deep BSDE 方法或 BSDE 的鞅方法。在理想与实际两种条件下建立了收敛结果,取决于优化准则是否降至零。在理想情况下,我们证明所提基于 FBSDE 的算法与标准策略迭代产生的策略序列具有相同的性能,从而具有相同的收敛速率。在实际情况下,所提算法仍被证明在优化误差的温和假设下鲁棒收敛。

关键词

引用

@article{arxiv.2210.07473,
  title  = {Probabilistic Framework of Howard's Policy Iteration: BML Evaluation and Robust Convergence Analysis},
  author = {Yutian Wang and Yuan-Hua Ni and Zengqiang Chen and Ji-Feng Zhang},
  journal= {arXiv preprint arXiv:2210.07473},
  year   = {2024}
}

备注

This work has been submitted to the IEEE for possible publication