中文

HG-DAgger:基于人类专家的交互式模仿学习

机器人学 2019-03-12 v2

摘要

模仿学习已被证明对许多现实世界问题很有用,但行为克隆等方法存在数据不匹配和误差累积问题。解决这些局限性的一种尝试是 DAgger 算法,它利用新手所诱导的状态分布从专家处采样纠正动作。然而,此类采样方案要求专家在未能完全控制系统的情况下提供动作标签。这会降低安全性,并且在使用人类作为专家时,由于感知到的执行器延迟,很可能降低所收集标签的质量。在这项工作中,我们提出 HG-DAgger,一种更适用于现实世界系统中基于人类专家的交互式模仿学习的 DAgger 变体。除了训练新手策略外,HG-DAgger 还学习一个基于模型不确定性的风险度量的安全阈值,可用于预测完全训练好的新手在状态空间不同区域中的表现。我们在模拟和真实世界的自动驾驶任务上评估了我们的方法,并展示了相对于 DAgger 和行为克隆的性能提升。

关键词

引用

@article{arxiv.1810.02890,
  title  = {HG-DAgger: Interactive Imitation Learning with Human Experts},
  author = {Michael Kelly and Chelsea Sidrane and Katherine Driggs-Campbell and Mykel J. Kochenderfer},
  journal= {arXiv preprint arXiv:1810.02890},
  year   = {2019}
}