中文

无需额外训练的检索增强生成加速扩散策略

机器学习 2025-07-30 v1 机器人学

摘要

扩散策略(DP)因其在各种模仿学习任务中实现显著精度提升的能力而受到关注。然而,DP依赖于扩散模型,该模型需要多个噪声去除步骤才能生成单个动作,导致生成时间较长。为了解决这个问题,提出了基于知识蒸馏的方法,如一致性策略(CP)。然而,这些方法需要大量的训练时间,特别是对于困难的任务。在本研究中,我们提出了RAGDP(检索增强生成用于扩散策略)作为一种新颖的框架,它利用知识库消除了额外训练的需要,以加速预训练DP的推理。具体来说,RAGDP通过DP编码器对观测-动作对进行编码,以构建专家演示的向量数据库。在推理过程中,当前观测被嵌入,并提取最相似的专家动作。该提取的动作与中间噪声去除步骤相结合,以减少相对于原始扩散步骤所需的步骤数。我们表明,通过将RAGDP与基础模型和现有加速方法结合使用,我们在无需额外训练的情况下改善了精度和速度之间的权衡。即使将模型加速20倍,RAGDP在精度上仍保持优势,比CP等蒸馏模型提高了7%。

关键词

引用

@article{arxiv.2507.21452,
  title  = {Retrieve-Augmented Generation for Speeding up Diffusion Policy without Additional Training},
  author = {Sodtavilan Odonchimed and Tatsuya Matsushima and Simon Holk and Yusuke Iwasawa and Yutaka Matsuo},
  journal= {arXiv preprint arXiv:2507.21452},
  year   = {2025}
}