SOS:面向混合马尔可夫决策过程的安全、最优且紧凑的策略
系统与控制
2021-02-02 v1 计算机科学中的逻辑
系统与控制
摘要
对于混合马尔可夫决策过程,UPPAAL Stratego 能够计算对给定安全性质安全且在(极限意义上)对给定代价函数最优的策略。遗憾的是,这些策略以极长的列表形式计算,难以导出。本文中,我们展示了以决策树形式学习这些策略的紧凑表示的方法。这些决策树体积小得多、更易理解,并且可轻松导出为可加载到嵌入式系统中的代码。尽管存在尺寸压缩以及与原始策略的实际差异,我们仍对决策树策略的安全性和最优性提供保证。此外,我们展示了如何获得更小的表示,其仍保证安全,但实现了尺寸与最优性之间的期望权衡。
引用
@article{arxiv.1906.10640,
title = {SOS: Safe, Optimal and Small Strategies for Hybrid Markov Decision Processes},
author = {Pranav Ashok and Jan Křetínský and Kim Guldstrand Larsen and Adrien Le Coënt and Jakob Haahr Taankvist and Maximilian Weininger},
journal= {arXiv preprint arXiv:1906.10640},
year = {2021}
}