中文

利用从单次演示中发现的例程增强策略学习

机器学习 2021-05-04 v4 人工智能 符号计算

摘要

人类能够从极少的数据中抽象出先验知识并用其促进技能学习。本文提出例程增强策略学习(RAPL),其从单次演示中发现由基本动作组成的例程,并利用发现的例程来增强策略学习。为从演示中发现例程,我们首先通过识别演示动作轨迹上的文法来抽象例程候选。然后,选取按长度和频率度量的最佳例程构成例程库。我们提出利用例程的时间结构,在基本动作层面和例程层面同时使用发现的例程学习策略。我们的方法能够在多个时间尺度上模仿专家行为以用于模仿学习,并促进强化学习的探索。在 Atari 游戏上的大量实验表明,RAPL 改进了最先进的模仿学习方法 SQIL 和强化学习方法 A2C。此外,我们展示了发现的例程可泛化到 CoinRun 基准上未见的关卡与难度。

关键词

引用

@article{arxiv.2012.12469,
  title  = {Augmenting Policy Learning with Routines Discovered from a Single Demonstration},
  author = {Zelin Zhao and Chuang Gan and Jiajun Wu and Xiaoxiao Guo and Joshua B. Tenenbaum},
  journal= {arXiv preprint arXiv:2012.12469},
  year   = {2021}
}

备注

AAAI 2021. Code is available at https://github.com/sjtuytc/AAAI21-RoutineAugmentedPolicyLearning