中文

基于随机最大值原理的批量逐样本随机最优控制

最优化与控制 2025-06-17 v2

摘要

本文主要从概率视角,即通过随机最大值原理(SMP)\cite{Peng4},研究随机最优控制问题(SOC)。我们采用\cite{Hui1}中提出的逐样本反向传播方案,在强凸性假设下求解SOC问题。重要的是,在随机梯度下降(SGD)过程中,我们在正向随机微分方程(SDE)中使用具有高阶格式的批量样本,将 \cite{Hui1} 中的收敛速度从 O(NK+1N)\sim \mathcal{O}(\sqrt{\frac{N}{K} + \frac{1}{N}}) 提高到 O(1K+1N2)\sim \mathcal{O}(\sqrt{\frac{1}{K} + \frac{1}{N^2}}),并指出不确定性的主要来源是反向随机微分方程(BSDE)中 ZZ 项的模拟格式。同时,我们注意到SGD过程仅使用了SMP的必要条件,而对BSDE近似解的批量模拟允许我们获得更精确的、使哈密顿量最小化的控制 uu 的估计。随后,我们提出了一种阻尼收缩算法来求解SOC问题,并在适当的假设下获得了其收敛性在特殊情况下的证明。我们展示了数值结果以检验投影算法的一阶收敛速度,并分析了阻尼收缩算法的收敛行为。最后,我们简要讨论了如何将所提出的方案应用于解决实际问题,特别是在使用随机化神经网络时。我们注意到,在这种特殊情况下,可以避免误差反向传播,并且参数更新可以通过纯代数计算(向量代数)实现,这可能会提高整个训练过程的效率。这一想法需要进一步探索,我们将留作未来的工作。

关键词

引用

@article{arxiv.2505.02688,
  title  = {Batch Sample-wise Stochastic Optimal Control via Stochastic Maximum Principle},
  author = {Hui Sun and Feng Bao},
  journal= {arXiv preprint arXiv:2505.02688},
  year   = {2025}
}

备注

Follow up work for a previous SINUM paper