基于决策树学习与泛化的参数化马尔可夫决策过程的1-2-3-Go!策略综合
人工智能
2025-04-02 v2 机器学习
计算机科学中的逻辑
系统与控制
系统与控制
摘要
尽管概率模型检查取得了进展,验证方法的可扩展性仍受限。特别是,当实例化参数化马尔可夫决策过程(MDPs)即使具有适中数值时,状态空间也会变得极其庞大。针对此类“巨型”MDPs的策略综合已超出现有工具的范围。我们提出一种基于学习的方法获取此类巨型MDPs的合理策略。核心思想是通过决策树学习将对小规模实例进行模型检查获得的最优策略推广到更大的实例,从而绕过对大规模模型进行显式状态空间探索的需求,为解决状态空间爆炸问题提供了一种实用方案。我们通过对量化验证基准集合中相关模型进行大规模实验来展示我们方法的有效性。实验结果表明,我们的策略在模型规模远超当今先进分析工具范围之外时仍表现良好。
关键词
引用
@article{arxiv.2410.18293,
title = {1-2-3-Go! Policy Synthesis for Parameterized Markov Decision Processes via Decision-Tree Learning and Generalization},
author = {Muqsit Azeem and Debraj Chakraborty and Sudeep Kanav and Jan Kretinsky and Mohammadsadegh Mohagheghi and Stefanie Mohr and Maximilian Weininger},
journal= {arXiv preprint arXiv:2410.18293},
year = {2025}
}
备注
Extended version of the paper accepted at VMCAI 2025