中文

期望还是保证?我全都要!博弈与 MDP 的十字路口

计算机科学与博弈论 2014-04-04 v1 形式语言与自动机理论 计算机科学中的逻辑

摘要

在推理代理的战略能力时,考虑其对手的性质至关重要。在定量规范控制器合成的特定背景下,通常的问题是为反应系统设计一种策略,以产生所需的性能,同时考虑到系统环境的潜在影响。看待这种环境至少有两种方式。在双人定量博弈的经典分析中,环境是纯粹对抗性的,问题在于提供严格的性能保证。在马尔可夫决策过程 (MDP) 中,环境被视为纯粹随机的:目标是优化期望收益,而不保证单个结果。在这篇说明性工作中,我们报告了引入“超越最坏情况合成”问题的最新结果,该问题旨在构建策略,以保证在最坏情况下满足某些定量要求,同时针对作为输入给出的特定环境随机模型提供更高的期望值。该问题与生成系统控制器相关,这些控制器在日常情况下提供良好的期望性能,同时即使在非常糟糕(尽管不太可能)的情况下也能确保严格(但放宽的)性能阈值。该问题已针对平均收益和最短路径定量度量进行了研究。

关键词

引用

@article{arxiv.1404.0834,
  title  = {Expectations or Guarantees? I Want It All! A crossroad between games and MDPs},
  author = {Véronique Bruyère and Emmanuel Filiot and Mickael Randour and Jean-François Raskin},
  journal= {arXiv preprint arXiv:1404.0834},
  year   = {2014}
}

备注

In Proceedings SR 2014, arXiv:1404.0414