Markov 博弈最优控制的高效近似
计算机科学与博弈论
2011-07-11 v2 系统与控制
最优化与控制
摘要
我们研究了连续时间 Markov 决策过程 (CTMDP) 与博弈 (CTMG) 的时间有界可达性问题。该问题的现有技术使用离散化技术将时间划分为离散区间,并对每个区间分别近似最优控制。现有技术在每个区间上提供 的精度,这导致区间数量大得不可行。我们提出了一系列近似,实现了 、 和 的精度,使我们能够大幅减少所考虑的区间数量。对于 CTMDP,所得算法的性能与 Buckholz 和 Schulz 给出的启发式方法相当,同时具有理论依据。我们所有的结果都可推广到 CTMG,对于该问题,我们的结果产生了首个实际可实现的算法。我们还为两名博弈方提供了达到类似误差界的位置策略。
引用
@article{arxiv.1011.0397,
title = {Efficient Approximation of Optimal Control for Markov Games},
author = {John Fearnley and Markus Rabe and Sven Schewe and Lijun Zhang},
journal= {arXiv preprint arXiv:1011.0397},
year = {2011}
}