中文

SOS:面向混合马尔可夫决策过程的安全、最优且紧凑的策略

系统与控制 2021-02-02 v1 计算机科学中的逻辑 系统与控制

摘要

对于混合马尔可夫决策过程,UPPAAL Stratego 能够计算对给定安全性质安全且在(极限意义上)对给定代价函数最优的策略。遗憾的是,这些策略以极长的列表形式计算,难以导出。本文中,我们展示了以决策树形式学习这些策略的紧凑表示的方法。这些决策树体积小得多、更易理解,并且可轻松导出为可加载到嵌入式系统中的代码。尽管存在尺寸压缩以及与原始策略的实际差异,我们仍对决策树策略的安全性和最优性提供保证。此外,我们展示了如何获得更小的表示,其仍保证安全,但实现了尺寸与最优性之间的期望权衡。

关键词

引用

@article{arxiv.1906.10640,
  title  = {SOS: Safe, Optimal and Small Strategies for Hybrid Markov Decision Processes},
  author = {Pranav Ashok and Jan Křetínský and Kim Guldstrand Larsen and Adrien Le Coënt and Jakob Haahr Taankvist and Maximilian Weininger},
  journal= {arXiv preprint arXiv:1906.10640},
  year   = {2021}
}