用于具有折扣和长期平均目标的随机博弈的放大镜抽象
计算机科学与博弈论
2011-07-13 v1
摘要
回合制随机博弈及其重要子类马尔可夫决策过程为具有概率和非确定性行为的系统提供了模型。我们考虑具有两种经典定量目标的回合制随机博弈:折扣和与长期平均目标。这些博弈模型和定量目标广泛应用于概率验证、规划、最优库存控制、网络协议和性能分析。模拟现实系统的博弈和马尔可夫决策过程通常具有非常大的状态空间,需要概率抽象技术来处理状态空间爆炸问题。常用的完全抽象技术对于许多状态具有相似值但未必具有相似转移结构的系统并不能节省空间。一种半抽象技术,即放大镜抽象,仅基于值对状态进行聚类,忽略其转移关系的差异,最初被提出用于定性目标(可达性和安全性目标)。在本文中,我们扩展了放大镜抽象技术,以求解具有折扣和与长期平均目标的随机博弈。我们提出了基于放大镜抽象的抽象-精化算法,用于具有折扣和目标的随机博弈和马尔可夫决策过程。对于长期平均目标,我们的解决方案适用于所有马尔可夫决策过程以及每个状态具有相同值的一类随机博弈。
引用
@article{arxiv.1107.2132,
title = {Magnifying Lens Abstraction for Stochastic Games with Discounted and Long-run Average Objectives},
author = {Krishnendu Chatterjee and Luca de Alfaro and Pritam Roy},
journal= {arXiv preprint arXiv:1107.2132},
year = {2011}
}