马尔可夫决策过程中计算状态相似性的方法
人工智能
2012-07-02 v1
摘要
解决大型概率系统的一种流行方法依赖于基于相似性度量来聚合状态。文献中的许多方法是启发式的。最近的一些方法则依赖于基于互模拟概念或状态间行为等价性的度量(Givan 等,2001,2003;Ferns 等,2004)。此类度量的一个组成部分是概率分布之间的 Kantorovich 度量。然而,尽管该度量具有许多令人满意的理论性质,但在实际中计算成本很高。在本文中,我们使用网络优化和统计采样技术来克服这一问题。我们以此方式获得了多种用于 MDP 状态聚合的距离函数,它们在时间和空间复杂度以及聚合质量之间的权衡上有所不同。我们提供了对这些权衡的实证评估。
引用
@article{arxiv.1206.6836,
title = {Methods for computing state similarity in Markov Decision Processes},
author = {Norman Ferns and Pablo Samuel Castro and Doina Precup and Prakash Panangaden},
journal= {arXiv preprint arXiv:1206.6836},
year = {2012}
}
备注
Appears in Proceedings of the Twenty-Second Conference on Uncertainty in Artificial Intelligence (UAI2006)