中文

马尔可夫决策过程中的安全探索

机器学习 2012-07-10 v3

摘要

在动力学不确定的环境中,探索对于学习如何良好表现是必要的。现有的强化学习算法提供了强大的探索保证,但它们往往依赖于遍历性假设。遍历性的本质是,通过遵循合适的策略,任何状态最终都可以从任何其他状态到达。这一假设允许探索算法通过简单地偏好之前很少访问的状态来运行。对于大多数物理系统,这一假设是不切实际的,因为在任何合理的探索发生之前系统就会损坏,即大多数物理系统不满足遍历性假设。本文解决了马尔可夫决策过程中对安全探索方法的需求。我们首先通过遍历性提出了安全的一般性表述。我们表明,通过将注意力限制在由此产生的保证安全策略集上来施加安全是NP难的。然后,我们提出了一种高效的算法,用于保证安全但可能次优的探索。核心是一个优化公式,其中约束将注意力限制在保证安全策略的一个子集上,而目标则偏向于探索策略。我们的框架与大多数先前提出的依赖探索奖励的探索方法兼容。我们的实验(包括一个火星地形探索问题)表明,我们的方法能够比经典探索方法更好地进行探索。

关键词

引用

@article{arxiv.1205.4810,
  title  = {Safe Exploration in Markov Decision Processes},
  author = {Teodor Mihai Moldovan and Pieter Abbeel},
  journal= {arXiv preprint arXiv:1205.4810},
  year   = {2012}
}