中文

DART:用于鲁棒模仿学习的噪声注入

机器学习 2018-02-01 v2

摘要

模仿学习的一种方法是行为克隆,其中机器人观察监督者并推断控制策略。这种“off-policy”方法的一个已知问题是,当偏离监督者的示范时,机器人的误差会累积。On-policy 技术通过迭代地为当前机器人策略收集纠正动作来缓解这一问题。然而,这些技术对人类监督者来说可能很繁琐,增加了显著的计算负担,并且可能在训练期间访问危险状态。我们提出了一种 off-policy 方法,在监督者示范时向其策略中注入噪声。这迫使监督者展示如何从错误中恢复。我们提出了一种新算法 DART(Disturbances for Augmenting Robot Trajectories),该算法收集注入噪声后的示范,并优化噪声水平以近似数据收集期间机器人训练策略的误差。我们在两个领域中将 DART 与 DAgger 和行为克隆进行了比较:在 MuJoCo 任务(Walker、Humanoid、Hopper、Half-Cheetah)上使用算法监督者的仿真中,以及在人类监督者训练 Toyota HSR 机器人在杂乱环境中执行抓取的物理实验中。对于像 Humanoid 这样的高维任务,DART 在计算时间上可快达 3x3x,且在训练期间仅使监督者的累积奖励降低 5%5\%,而 DAgger 执行的策略的累积奖励比监督者少 80%80\%。在杂乱环境抓取任务中,DART 平均比行为克隆性能提升 62%62\%

关键词

引用

@article{arxiv.1703.09327,
  title  = {DART: Noise Injection for Robust Imitation Learning},
  author = {Michael Laskey and Jonathan Lee and Roy Fox and Anca Dragan and Ken Goldberg},
  journal= {arXiv preprint arXiv:1703.09327},
  year   = {2018}
}