中文

从观测中得到的感知价值

机器学习 2019-05-21 v1 人工智能 机器学习

摘要

观测模仿是一种从缺乏动作信息的专家演示(如视频)中学习的方法。解决该问题的近期方法可分为两大类:训练旨在预测状态间所采取动作的动力学模型,以及学习奖励或用于计算奖励的特征以用于强化学习(RL)。本文中,我们提出一种直接从观测中学习价值而非奖励的新方法。我们表明,与使用稀疏奖励设定相比,通过学习价值,我们可通过消除自举动作价值的需求来显著加速RL。

关键词

引用

@article{arxiv.1905.07861,
  title  = {Perceptual Values from Observation},
  author = {Ashley D. Edwards and Charles L. Isbell},
  journal= {arXiv preprint arXiv:1905.07861},
  year   = {2019}
}

备注

Accepted into the Workshop on Self-Supervised Learning at ICML 2019