中文

多目标 MDP 中的简单策略(技术报告)

计算机科学中的逻辑 2020-02-18 v3 人工智能

摘要

我们考虑在马尔可夫决策过程(MDPs)上一次性验证多个期望奖励目标。这通过获得帕累托前沿实现了多个目标之间的权衡分析。我们聚焦于易于使用和实现的策略,即纯策略(无随机化)且具有有界内存的策略。我们证明了检查一个点是否可由纯平稳策略实现是 NP 完全的,即便对于两个目标也是如此,并且我们提供了求解相应问题的 MILP 编码。有界内存情形可通过积构造归约到平稳情形。使用 \Storm 和 Gurobi 的实验结果展示了我们算法的可行性。

关键词

引用

@article{arxiv.1910.11024,
  title  = {Simple Strategies in Multi-Objective MDPs (Technical Report)},
  author = {Florent Delgrange and Joost-Pieter Katoen and Tim Quatmann and Mickael Randour},
  journal= {arXiv preprint arXiv:1910.11024},
  year   = {2020}
}