中文

控制程序的分层变分模仿学习

机器学习 2020-01-01 v1 机器学习

摘要

自主智能体可通过模仿教师演示的预期行为来学习。分层控制策略对此类学习普遍有用,有潜力将结构化任务分解为更简单的子任务,从而提高数据效率与泛化能力。本文中,我们提出一种变分推断方法,用于模仿学习由参数化分层过程(PHP)表示的控制策略——一种过程可调用子过程以执行子任务、类程序的结构。我们的方法通过学习关于潜在过程调用与终止序列的近似后验分布,在教师演示的观察-动作轨迹数据集中发现分层结构。该学习分布中的样本随后引导分层控制策略的训练。我们识别并展示了在分层模仿学习背景下变分推断的一个新颖益处:在将策略分解为更简单的过程中,推断可利用其他方法中未使用的非因果信息。使用变分推断训练 PHP 在数据效率与泛化上优于 LSTM 基线,在执行冒泡排序算法时所需数据不到一半即可达到 24% 错误率,并在执行 Karel 程序时达到无错误。

关键词

引用

@article{arxiv.1912.12612,
  title  = {Hierarchical Variational Imitation Learning of Control Programs},
  author = {Roy Fox and Richard Shin and William Paul and Yitian Zou and Dawn Song and Ken Goldberg and Pieter Abbeel and Ion Stoica},
  journal= {arXiv preprint arXiv:1912.12612},
  year   = {2020}
}