拓扑值迭代算法
人工智能
2014-01-17 v1
摘要
值迭代是求解马尔可夫决策过程(MDP)的一种强大但低效的算法,因为它将大部分精力用于对整个状态空间进行备份,而这在许多情况下是不必要的。为了克服这个问题,人们提出了许多方法。其中,ILAO*和RTDP的变体是最先进的。这些方法使用可达性分析和启发式搜索来避免一些不必要的备份。然而,这些方法都没有在预处理步骤中构建状态转移的图结构,也没有利用结构信息来系统地分解问题,从而生成状态空间的智能备份序列。在本文中,我们提出了两种最优的MDP算法。第一种算法,拓扑值迭代(TVI),检测MDP的结构并基于拓扑序列备份状态。它(1)将MDP划分为强连通分量(SCC),并(2)按顺序求解这些分量。当MDP具有多个大小相近的SCC时,TVI远远优于VI和其他最先进的算法。第二种算法,聚焦拓扑值迭代(FTVI),是TVI的扩展。FTVI将注意力限制在与求解MDP相关的连通分量上。具体而言,它使用少量的启发式搜索来消除可证明次优的动作;这种剪枝使FTVI能够找到更小的连通分量,从而运行得更快。我们证明,在多个领域上的平均表现中,FTVI比TVI快一个数量级。令人惊讶的是,在许多领域中,FTVI也显著优于流行的启发式MDP算法,如ILAO*、LRTDP、BRTDP和Bayesian-RTDP,有时甚至快达两个数量级。最后,我们刻画了FTVI擅长的领域类型——为明智地选择求解器提供了一种方法。
引用
@article{arxiv.1401.3910,
title = {Topological Value Iteration Algorithms},
author = {Peng Dai and Mausam and Daniel Sabby Weld and Judy Goldsmith},
journal= {arXiv preprint arXiv:1401.3910},
year = {2014}
}