Diffusion 遇见 DAgger:增强眼在手模仿学习
机器人学
2024-06-06 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
通过模仿学习训练的策略在测试时常见的失败模式是执行误差的累积。当学习到的策略遇到专家演示中不存在的状态时,策略会失效,导致退化行为。针对此问题的 Dataset Aggregation(DAgger)方法仅仅是收集更多数据以覆盖这些失败状态。然而在实践中,这往往成本过高。在本工作中,我们提出了 Diffusion Meets DAgger (DMD),一种无需高昂成本即可为眼在手(eye-in-hand)模仿学习问题带来 DAgger 益处的方法。DMD 不是收集新样本来覆盖分布外状态,而是利用扩散模型的最新进展来合成这些样本。这使得仅凭少量演示即可实现鲁棒性能。我们在推、堆叠、倾倒和挂衬衫四个任务上将 DMD 与行为克隆基线进行了比较。在推的任务中,DMD 仅用 8 次专家演示即可达到 80% 的成功率,而朴素的行为克隆仅达到 20%。在堆叠任务中,DMD 在 5 个杯子上的平均成功率为 92%,而行为克隆为 40%。在倾倒咖啡豆时,DMD 成功转移到另一个杯子的概率为 80%。最后,DMD 在将衬衫挂在衣架上的任务中达到了 90% 的成功率。
引用
@article{arxiv.2402.17768,
title = {Diffusion Meets DAgger: Supercharging Eye-in-hand Imitation Learning},
author = {Xiaoyu Zhang and Matthew Chang and Pranav Kumar and Saurabh Gupta},
journal= {arXiv preprint arXiv:2402.17768},
year = {2024}
}
备注
Accepted by Robotics: Science and Systems (RSS) 2024. project website with video, see https://sites.google.com/view/diffusion-meets-dagger