中文

Markov 博弈最优控制的高效近似

计算机科学与博弈论 2011-07-11 v2 系统与控制 最优化与控制

摘要

我们研究了连续时间 Markov 决策过程 (CTMDP) 与博弈 (CTMG) 的时间有界可达性问题。该问题的现有技术使用离散化技术将时间划分为离散区间,并对每个区间分别近似最优控制。现有技术在每个区间上提供 O(ϵ2)O(\epsilon^2) 的精度,这导致区间数量大得不可行。我们提出了一系列近似,实现了 O(ϵ3)O(\epsilon^3)O(ϵ4)O(\epsilon^4)O(ϵ5)O(\epsilon^5) 的精度,使我们能够大幅减少所考虑的区间数量。对于 CTMDP,所得算法的性能与 Buckholz 和 Schulz 给出的启发式方法相当,同时具有理论依据。我们所有的结果都可推广到 CTMG,对于该问题,我们的结果产生了首个实际可实现的算法。我们还为两名博弈方提供了达到类似误差界的位置策略。

关键词

引用

@article{arxiv.1011.0397,
  title  = {Efficient Approximation of Optimal Control for Markov Games},
  author = {John Fearnley and Markus Rabe and Sven Schewe and Lijun Zhang},
  journal= {arXiv preprint arXiv:1011.0397},
  year   = {2011}
}