中文

离动力学条件扩散规划器

机器学习 2024-10-17 v1 机器人学

摘要

离线强化学习 (RL) 通过利用现有数据集提供了与交互式数据获取的引人注目的替代方案。然而,其有效性取决于数据样本的数量和质量。本工作探索了使用更易获得但偏离动力学的数据集,以解决离线 RL 中数据稀缺的挑战。我们提出了一种新方法,利用条件扩散概率模型 (DPM) 学习大规模离动力学数据集与有限目标数据集的联合分布。为使模型能够捕捉 underlying dynamics 结构,我们引入两种上下文用于条件模型:(1) 连续动力学得分允许两组轨迹之间存在部分重叠,为模型提供更丰富的信息;(2) 逆动力学上下文引导模型生成遵循目标环境动态约束的轨迹。实验结果表明,我们的方法显著优于几个强大的基线。消融研究进一步揭示了每个动力学上下文的关键作用。此外,我们的模型显示,通过修改上下文,可以在源动力学和目标动力学之间进行插值,使其对环境中细微变化更具鲁棒性。

关键词

引用

@article{arxiv.2410.12238,
  title  = {Off-dynamics Conditional Diffusion Planners},
  author = {Wen Zheng Terence Ng and Jianda Chen and Tianwei Zhang},
  journal= {arXiv preprint arXiv:2410.12238},
  year   = {2024}
}