从观测中模仿潜在策略
机器学习
2019-05-14 v3 机器学习
摘要
本文中,我们描述了一种从状态观测直接推断潜在策略的模仿学习新方法。我们引入一种方法,在表征潜在动作对观测的因果效应的同时预测其似然。随后我们概述一种动作对齐过程,其利用少量环境交互来确定潜在动作与真实世界动作间的映射。我们表明,即便未给出专家动作,该修正标签也可用于模仿所观测行为。我们在经典控制环境与一个平台游戏中评估了我们的方法,并证明其优于标准方法。本工作的代码见 https://github.com/ashedwards/ILPO。
引用
@article{arxiv.1805.07914,
title = {Imitating Latent Policies from Observation},
author = {Ashley D. Edwards and Himanshu Sahni and Yannick Schroecker and Charles L. Isbell},
journal= {arXiv preprint arXiv:1805.07914},
year = {2019}
}
备注
Accepted to ICML 2019