中文

利用运动策略序列让策略性内在动机学习者掌握一组相互关联任务

人机交互 2019-02-18 v2 人工智能 机器人学

摘要

我们提出一种用于机器人的主动学习架构,能够通过学习称为内在动机过程 babbling(IM-PB)的运动策略序列来组织其学习过程,以实现一系列复杂任务。学习者可对其经验进行泛化,从而持续学习新任务。它基于自身进步的实证度量,主动选择学习什么及如何学习。在本文中,我们考虑学习一组按层次组织的相互关联任务结果。我们引入称为“过程(procedures)”的框架,即由已学技能组合定义的政策序列。我们的算法架构利用这些过程自主发现如何组合简单技能以实现复杂目标。它在两种目标导向探索策略间主动选择:策略空间探索或过程空间探索。我们在模拟环境中展示,我们的新架构能够应对复杂运动策略的学习,并使策略复杂度适配手头任务。我们还展示了我们的“过程”框架有助于学习者处理困难的层次化任务。

关键词

引用

@article{arxiv.1810.04877,
  title  = {Learning a Set of Interrelated Tasks by Using Sequences of Motor Policies for a Strategic Intrinsically Motivated Learner},
  author = {Nicolas Duminy and Sao Mai Nguyen and Dominique Duhaut},
  journal= {arXiv preprint arXiv:1810.04877},
  year   = {2019}
}