中文

模仿学习的泛化保证

机器人学 2020-12-04 v2 机器学习 系统与控制 系统与控制 最优化与控制

摘要

由于演示不完善或模仿学习算法无法准确推断专家策略,模仿学习得到的控制策略常难以泛化到新环境。本文利用可能近似正确(PAC)-贝叶斯框架为模仿学习提供严格的泛化保证,给出新环境下策略期望代价的上界。我们提出一种两阶段训练方法:首先用条件变分自编码器将多模态专家行为嵌入潜策略分布,随后在新训练环境中“微调”以显式优化泛化界。我们在仿真中展示了强泛化界及其相对于(i)抓取多样杯子、(ii)带视觉反馈的平面推动、(iii)基于视觉的室内导航经验表现的紧致性,并通过硬件实验验证了前两个操作任务。

关键词

引用

@article{arxiv.2008.01913,
  title  = {Generalization Guarantees for Imitation Learning},
  author = {Allen Z. Ren and Sushant Veer and Anirudha Majumdar},
  journal= {arXiv preprint arXiv:2008.01913},
  year   = {2020}
}

备注

Presented at the Conference on Robot Learning (CoRL), 2020