能量马尔可夫决策过程中的期望平均收益优化
计算机科学中的逻辑
2016-07-05 v1
摘要
能量马尔可夫决策过程(EMDPs)是有限状态马尔可夫决策过程,其中每个转移被赋予一个整数计数器更新和一个有理数收益。一个 EMDP 构型是一个对 s(n),其中 s 是控制状态,n 是当前计数器值。构型通过以标准方式执行转移而改变。我们考虑计算一个安全策略(即保持计数器非负的策略)的问题,该策略最大化期望平均收益。
引用
@article{arxiv.1607.00678,
title = {Optimizing the Expected Mean Payoff in Energy Markov Decision Processes},
author = {Tomáš Brázdil and Antonín Kučera and Petr Novotný},
journal= {arXiv preprint arXiv:1607.00678},
year = {2016}
}
备注
Full version of a paper published in proceedings of ATVA'16