从观测中得到的感知价值
机器学习
2019-05-21 v1 人工智能
机器学习
摘要
观测模仿是一种从缺乏动作信息的专家演示(如视频)中学习的方法。解决该问题的近期方法可分为两大类:训练旨在预测状态间所采取动作的动力学模型,以及学习奖励或用于计算奖励的特征以用于强化学习(RL)。本文中,我们提出一种直接从观测中学习价值而非奖励的新方法。我们表明,与使用稀疏奖励设定相比,通过学习价值,我们可通过消除自举动作价值的需求来显著加速RL。
引用
@article{arxiv.1905.07861,
title = {Perceptual Values from Observation},
author = {Ashley D. Edwards and Charles L. Isbell},
journal= {arXiv preprint arXiv:1905.07861},
year = {2019}
}
备注
Accepted into the Workshop on Self-Supervised Learning at ICML 2019