中文

马尔可夫决策过程在线规划中的简单遗憾优化

人工智能 2012-12-20 v2 机器学习

摘要

我们考虑马尔可夫决策过程(MDP)中的在线规划。在在线规划中,智能体仅关注当前状态,从该状态出发思考可能策略的集合,并在被中断时利用该探索性思考的结果来选择下一步要执行的动作。在线规划算法的性能通过简单遗憾来评估,即当执行所选动作而非最优动作时智能体的期望性能损失。迄今为止,针对一般MDP的在线规划最先进算法要么是尽力而为,要么仅保证简单遗憾随时间呈多项式速率降低。本文引入了一种新的蒙特卡洛树搜索算法BRUE,该算法保证简单遗憾和错误概率呈指数速率降低。该算法基于一种简单但非标准的状态空间采样方案MCTS2e,其中每个样本的不同部分用于不同的探索目标。我们的实证评估表明,BRUE不仅提供了优越的性能保证,而且在实践中非常有效,并与最先进方法相比具有优势。然后,我们通过一种“遗忘学习”变体扩展了BRUE。由此产生的算法集BRUE(α)推广了BRUE,改进了其降低率上界中的指数因子,并展现出更具吸引力的实证性能。

关键词

引用

@article{arxiv.1206.3382,
  title  = {Simple Regret Optimization in Online Planning for Markov Decision Processes},
  author = {Zohar Feldman and Carmel Domshlak},
  journal= {arXiv preprint arXiv:1206.3382},
  year   = {2012}
}