中文

回到此处:基于返回分布规划的鲁棒模仿学习

机器人学 2023-05-03 v1 人工智能 机器学习 系统与控制 系统与控制

摘要

我们考虑这样一种模仿学习(IL)设定:专家数据并非在实际部署环境中收集,而是在一个不同版本的环境中收集。为应对由此产生的分布偏移,我们将行为克隆(BC)与一个规划器结合,该规划器的任务是当智能体偏离演示分布时将其带回专家访问过的状态。所得算法POIR可离线训练,并利用在线交互高效微调其规划器以随时间提升性能。我们在真实机器人操作模拟器中对多种人类生成的操作演示测试了POIR,展示了所学策略对不同初始状态分布与噪声动态的鲁棒性。

关键词

引用

@article{arxiv.2305.01400,
  title  = {Get Back Here: Robust Imitation by Return-to-Distribution Planning},
  author = {Geoffrey Cideron and Baruch Tabanpour and Sebastian Curi and Sertan Girgin and Leonard Hussenot and Gabriel Dulac-Arnold and Matthieu Geist and Olivier Pietquin and Robert Dadashi},
  journal= {arXiv preprint arXiv:2305.01400},
  year   = {2023}
}