MultiGain:用于具有多重平均报酬目标的马尔可夫决策过程的控制器综合工具
人工智能
2015-01-14 v1 计算机科学中的逻辑
摘要
我们提出 MultiGain,一个为具有多重平均报酬目标的马尔可夫决策过程(MDPs)合成策略的工具。我们的模型在 PRISM 中描述,且我们的工具使用 PRISM 现有的接口和模拟器。我们的工具通过添加用于多重平均报酬目标的新颖算法来扩展 PRISM,并且还提供诸如(i)生成策略并探索它们进行模拟,以及针对其他性质检查它们;和(ii)为两个平均报酬目标生成近似帕累托曲线的特征。此外,我们提出一个新的实用算法,用于在记忆无关策略下分析具有多重平均报酬目标的 MDPs。
引用
@article{arxiv.1501.03093,
title = {MultiGain: A controller synthesis tool for MDPs with multiple mean-payoff objectives},
author = {Tomáš Brázdil and Krishnendu Chatterjee and Vojtěch Forejt and Antonín Kučera},
journal= {arXiv preprint arXiv:1501.03093},
year = {2015}
}
备注
Extended version for a TACAS 2015 tool demo paper