利用宏动作分层求解马尔可夫决策过程
人工智能
2013-02-01 v1
摘要
我们研究了时间抽象动作(即宏动作)在马尔可夫决策过程求解中的应用。与当前结合原始动作和宏动作且保持状态空间不变的模型不同,我们提出了一种仅使用宏动作的分层模型(利用抽象 MDP),该模型能显著减小状态空间的规模。这是通过将宏动作视为在状态空间特定区域起作用的局部策略,并将抽象 MDP 中的状态限制为区域边界处的状态来实现的。抽象 MDP 是对原始 MDP 的近似,且能更高效地求解。我们讨论了几种生成宏动作以确保解质量的方法。最后,我们探讨了如何复用宏动作来求解多个相关的 MDP,并表明这可以证明宏动作生成所带来的计算开销是合理的。
引用
@article{arxiv.1301.7381,
title = {Hierarchical Solution of Markov Decision Processes using Macro-actions},
author = {Milos Hauskrecht and Nicolas Meuleau and Leslie Pack Kaelbling and Thomas L. Dean and Craig Boutilier},
journal= {arXiv preprint arXiv:1301.7381},
year = {2013}
}
备注
Appears in Proceedings of the Fourteenth Conference on Uncertainty in Artificial Intelligence (UAI1998)