中文

能量马尔可夫决策过程中的期望平均收益优化

计算机科学中的逻辑 2016-07-05 v1

摘要

能量马尔可夫决策过程(EMDPs)是有限状态马尔可夫决策过程,其中每个转移被赋予一个整数计数器更新和一个有理数收益。一个 EMDP 构型是一个对 s(n),其中 s 是控制状态,n 是当前计数器值。构型通过以标准方式执行转移而改变。我们考虑计算一个安全策略(即保持计数器非负的策略)的问题,该策略最大化期望平均收益。

关键词

引用

@article{arxiv.1607.00678,
  title  = {Optimizing the Expected Mean Payoff in Energy Markov Decision Processes},
  author = {Tomáš Brázdil and Antonín Kučera and Petr Novotný},
  journal= {arXiv preprint arXiv:1607.00678},
  year   = {2016}
}

备注

Full version of a paper published in proceedings of ATVA'16