中文

回放缓冲上的冷扩散:从已知良好状态学习规划

机器人学 2023-10-24 v1

摘要

从演示中学习(LfD)已成功训练机器人展现出显著的泛化能力。然而,许多强大的模仿技术并未优先考虑其所生成机器人行为的可行性。本工作中,我们探究 LfD 所产生规划的可行性。如先前工作,我们采用具有固定起始与目标状态的时序扩散模型,通过修复(in-painting)促进模仿。与以往研究不同,我们应用冷扩散以确保优化过程经由智能体先前访问状态的回放缓冲进行引导。该路由方法增加了最终轨迹主要占据机器人状态空间可行区域的可能性。我们在含障碍的仿真机器人环境中测试该方法,观察到智能体在规划期间规避这些障碍的能力显著提升。

关键词

引用

@article{arxiv.2310.13914,
  title  = {Cold Diffusion on the Replay Buffer: Learning to Plan from Known Good States},
  author = {Zidan Wang and Takeru Oba and Takuma Yoneda and Rui Shen and Matthew Walter and Bradly C. Stadie},
  journal= {arXiv preprint arXiv:2310.13914},
  year   = {2023}
}