中文

奖励不确定MDP的几何遍历算法

人工智能 2012-02-20 v1

摘要

马尔可夫决策过程(MDP)广泛用于随机环境中的决策问题建模。然而,MDP中奖励函数的精确指定通常非常困难。最近的方法集中于基于最小最大遗憾准则计算最优策略,以获得在奖励函数不确定性下的鲁棒策略。计算最小最大遗憾策略的核心任务之一是获取所有可能对某个候选奖励函数最优的策略集合。在本文中,我们提出一种高效算法,利用与策略相关的奖励函数的几何性质。我们还提出一种近似版本以进一步加速。实验表明,我们的算法将性能提升了几个数量级。

关键词

引用

@article{arxiv.1202.3754,
  title  = {A Geometric Traversal Algorithm for Reward-Uncertain MDPs},
  author = {Eunsoo Oh and Kee-Eung Kim},
  journal= {arXiv preprint arXiv:1202.3754},
  year   = {2012}
}