中文

基于值先验的模仿学习

机器学习 2012-06-26 v1 人工智能 机器学习

摘要

模仿学习的目标是让学徒通过观察导师演示正确行为来学习如何在随机环境中行动。关于正确行为的准确先验知识可以减少对导师演示的需求。我们提出了一种编码正确行为先验知识的新方法,其中我们假设该先验知识采用马尔可夫决策过程(MDP)的形式,学徒将其用作导师行为的粗略且不完美的模型。具体来说,采用贝叶斯方法,我们将该建模MDP中策略的值视为该策略的对数先验概率。换句话说,我们先验地假设导师的行为很可能是建模MDP中的高值策略,尽管很可能与最优策略不同。我们描述了一种高效算法,给定建模MDP和导师的一组演示,该算法可证明收敛到导师策略的对数后验的驻点,其中后验是根据“基于值”的先验计算的。我们还提供了经验证据,表明该先验确实加速了导师策略的学习,并且在我们的实验中优于先前类似方法。

关键词

引用

@article{arxiv.1206.5290,
  title  = {Imitation Learning with a Value-Based Prior},
  author = {Umar Syed and Robert E. Schapire},
  journal= {arXiv preprint arXiv:1206.5290},
  year   = {2012}
}

备注

Appears in Proceedings of the Twenty-Third Conference on Uncertainty in Artificial Intelligence (UAI2007)