中文

基于分数扩散策略的目标条件模仿学习

机器学习 2023-06-02 v2 机器人学

摘要

我们提出了一种基于分数扩散模型(SDMs)的新策略表示。我们将这一新策略表示应用于目标条件模仿学习(GCIL)领域,以从大规模未筛选数据集中无需奖励地学习通用目标指定策略。我们的新目标条件策略架构“基于分数扩散策略的行为生成”(BESO,即 BE\textbf{BE}havior generation with S\textbf{S}cO\textbf{O}re-based Diffusion Policies)利用生成式、基于分数的扩散模型作为其策略。BESO 将分数模型的学习与推理采样过程解耦,因此允许快速的采样策略,仅需 3 个去噪步即可生成目标指定行为,而其他基于扩散的策略需要 30+ 步。此外,BESO 具有高度表达能力,可有效捕捉 play 数据解空间中存在的多模态。与 Latent Plans 或 C-Bet 等先前方法不同,BESO 不依赖复杂的层次化策略或额外的聚类来实现有效的目标条件行为学习。最后,我们展示了 BESO 甚至可以通过无分类器引导(classifier-free guidance)从 play-data 中学习目标无关策略。据我们所知,这是首项工作:a) 基于此种解耦 SDM 表示行为策略;b) 在 GCIL 领域学习基于 SDM 的策略;c) 提供从 play-data 同时学习目标依赖与目标无关策略的方法。我们通过详细的仿真评估 BESO,表明其在具有挑战性的基准上持续优于多种最先进的目标条件模仿学习方法。我们还提供了广泛的消融研究与实验,以证明我们的方法在目标条件行为生成上的有效性。演示与代码可在 https://intuitive-robots.github.io/beso-website/ 获取。

关键词

引用

@article{arxiv.2304.02532,
  title  = {Goal-Conditioned Imitation Learning using Score-based Diffusion Policies},
  author = {Moritz Reuss and Maximilian Li and Xiaogang Jia and Rudolf Lioutikov},
  journal= {arXiv preprint arXiv:2304.02532},
  year   = {2023}
}

备注

Accepted at RSS 2023