中文

通过观察专家推断与学习多机器人策略

机器人学 2020-03-04 v2

摘要

我们提出了一种通过观测专家系统执行同一任务来学习解决需要与外部环境交互的多机器人任务的技术。我们将专家系统定义为一支装备有控制器库的机器人团队,每个控制器设计用于解决特定任务,并由一个专家策略监督,该策略根据机器人与环境的状态恰当选择控制器。目标是让一支未经训练的机器人团队(即模仿系统)装备相同的控制器库,但不知晓专家策略,去执行该任务,并取得与专家系统相当的性能。从未标注的专家系统观测中,采用多假设滤波技术估计专家策略所执行的各个控制器。随后,利用估计控制器与环境状态的历史来为模仿系统训练一个神经网络策略。考虑一支差分驱动机器人团队的周边保护场景,我们表明所学策略赋予模仿系统与专家系统相当的性能。

关键词

引用

@article{arxiv.1909.07887,
  title  = {Inferring and Learning Multi-Robot Policies by Observing an Expert},
  author = {Pietro Pierpaoli and Harish Ravichandar and Nicholas Waytowich and Anqi Li and Derrik Asher and Magnus Egerstedt},
  journal= {arXiv preprint arXiv:1909.07887},
  year   = {2020}
}

备注

8 pages, 7 figures