中文

关于随机微分博弈中的伴随马尔可夫策略

最优化与控制 2019-03-26 v1

摘要

我们考虑区域中的时齐一致非退化随机微分博弈,并提出通过使用伴随马尔可夫策略和伴随马尔可夫策略来构造 ε\varepsilon-最优策略和方针,这些策略实际上是时齐马尔可夫的,但不是相对于原始过程,而是相对于由原始主方程和与主方程同类型的伴随随机方程组成的系统所控制的两个过程。我们展示了如何通过在 Sobolev 空间中求解非原始 Isaacs 方程而是其适当修正的可解性,在这些类中找到 ε\varepsilon-最优策略和方针。我们还给出了一个一致非退化博弈的例子,其中我们的假设不成立,并且我们猜想,对于其中一名玩家,不仅不存在最优马尔可夫策略,甚至不存在 ε\varepsilon-最优伴随(时齐)马尔可夫策略。

关键词

引用

@article{arxiv.1903.10072,
  title  = {On the adjoint Markov policies in stochastic differential games},
  author = {N. V. Krylov},
  journal= {arXiv preprint arXiv:1903.10072},
  year   = {2019}
}

备注

22 pages