中文

扩散模型增强的行为克隆

机器学习 2024-06-04 v4 人工智能 机器人学

摘要

模仿学习解决了在无法获取环境奖励信号的情况下通过观测专家演示进行学习的难题。大多数不需要与环境交互的现有模仿学习方法要么将专家分布建模为条件概率 p(a|s)(例如行为克隆,BC),要么建模为联合概率 p(s, a)。尽管用 BC 建模条件概率十分简单,其通常难以泛化。而建模联合概率虽可提升泛化性能,推理过程往往耗时,且模型可能出现流形过拟合。本工作提出一种同时受益于建模专家分布条件概率与联合概率的模仿学习框架。我们提出的扩散模型增强的行为克隆(DBC)采用一个经训练以建模专家行为的扩散模型,并学习一个策略来同时优化 BC 损失(条件)与我们提出的扩散模型损失(联合)。DBC 在导航、机械臂操控、灵巧手操控与运动等多种连续控制任务中优于基线方法。我们设计了额外实验以验证仅建模专家分布条件概率或联合概率的局限性,并比较了不同生成模型。消融研究证实了我们的设计选择的有效性。

关键词

引用

@article{arxiv.2302.13335,
  title  = {Diffusion Model-Augmented Behavioral Cloning},
  author = {Shang-Fu Chen and Hsiang-Chun Wang and Ming-Hao Hsu and Chun-Mao Lai and Shao-Hua Sun},
  journal= {arXiv preprint arXiv:2302.13335},
  year   = {2024}
}

备注

ICML 2024