通过模仿具有混合行为的演示学习多模态策略
机器学习
2019-03-26 v1 机器学习
摘要
我们提出一种新方法,用于从无行为标签的混合演示中训练多模态策略。我们开发了发现演示中变异潜在因子的方法。具体而言,我们的方法基于带类别潜变量的变分自编码器。编码器从演示中推断对应于不同行为的离散潜在因子。解码器作为策略,相应地执行这些行为。一旦学习完成,该策略只需以类别向量为条件即可复现特定行为。我们在三项不同任务上评估了我们的方法,包括一项具有高维视觉输入的挑战性任务。实验结果表明,我们的方法优于多种基线方法,并与由真实行为标签训练的多模态策略具有竞争力。
引用
@article{arxiv.1903.10304,
title = {Learning a Multi-Modal Policy via Imitating Demonstrations with Mixed Behaviors},
author = {Fang-I Hsiao and Jui-Hsuan Kuo and Min Sun},
journal= {arXiv preprint arXiv:1903.10304},
year = {2019}
}
备注
10pages, 4 figures, NIPS 2018 workshop