中文

通过策略与辅助轨迹同步优化的模仿学习

机器人学 2021-06-08 v2 机器学习

摘要

模仿学习(IL)是一种常用于数据高效策略学习的方法。许多 IL 方法,如 Dataset Aggregation (DAgger),通过与神谕专家交互来应对分布偏移等挑战。遗憾的是,在实践中假设可访问神谕专家往往不现实;IL 中使用的数据通常来自离线过程,如示教(lead-through)或遥操作。本文提出一种称为 Collocation for Demonstration Encoding (CoDE) 的新型模仿学习技术,其仅在一组固定的轨迹演示上运行。我们受最优控制中配置法(collocation)技术的启发,引入辅助轨迹网络,从而规避了随时间反向传播等方法带来的挑战。与标准行为克隆方法相比,我们的方法泛化性更好,并能以更少的引导轨迹更准确地复现演示行为。我们给出了一个 7 自由度(DoF)机械臂的仿真结果,该机械臂学会了展现抓取、目标到达和避障行为。

关键词

引用

@article{arxiv.2105.03019,
  title  = {Imitation Learning via Simultaneous Optimization of Policies and Auxiliary Trajectories},
  author = {Mandy Xie and Anqi Li and Karl Van Wyk and Frank Dellaert and Byron Boots and Nathan Ratliff},
  journal= {arXiv preprint arXiv:2105.03019},
  year   = {2021}
}