中文

随机博弈中与公平对手博弈的总回报问题

计算机科学中的逻辑 2022-05-20 v2

摘要

我们研究零和、回合制、双人随机博弈,其中一名玩家的目标是最大化一次博弈过程中获得的奖励总量,而另一名玩家旨在最小化该总量。我们关注最小化方以公平方式行事的博弈。我们认为这类博弈在软件验证中具有有趣的应用:最大化方扮演旨在最大化所达成“里程碑”数量的系统,而最小化方代表某种不合作但公平的外部环境行为。通常,为研究总回报性质,要求博弈是停止的(即它们以概率1到达终止状态)。我们放宽该性质,仅要求博弈在公平的极小化玩家下是停止的。我们证明这些博弈具有确定性,即博弈的每个状态都定义了一个值。此外,我们证明双方都具有无记忆且确定性的最优策略,且博弈值可通过逼近一组函数方程的最大不动点来计算。我们在原型工具中实现了该方法,并在一个说明性示例和无人机(Unmanned Aerial Vehicle)案例研究中进行了评估。

关键词

引用

@article{arxiv.2112.09811,
  title  = {Playing Against Fair Adversaries in Stochastic Games with Total Rewards},
  author = {Pablo F. Castro and Pedro R. D'Argenio and Luciano Putruele and Ramiro Demasi},
  journal= {arXiv preprint arXiv:2112.09811},
  year   = {2022}
}