中文

扩散策略的变分蒸馏为混合专家模型

机器学习 2024-10-22 v2 人工智能 机器人学

摘要

本文介绍了变分扩散蒸馏(VDD),一种通过变分推断将去噪扩散策略蒸馏为混合专家模型(MoE)的新方法。扩散模型因其在准确学习和表示复杂多模态分布方面的卓越能力,成为当前生成建模领域的最先进技术。这种能力使得扩散模型能够复现人类行为中固有的多样性,使其成为行为学习(如从人类示范中学习,LfD)中的首选模型。然而,扩散模型也存在一些缺点,包括似然性难以处理以及由于其迭代采样过程导致的推理时间较长。特别是推理时间对机器人控制等实时应用构成了重大挑战。相比之下,MoE有效地解决了上述问题,同时保留了表示复杂分布的能力,但众所周知难以训练。VDD是第一种将预训练扩散模型蒸馏为MoE模型的方法,因此结合了扩散模型的表达能力和混合模型的优势。具体来说,VDD利用变分目标的一个分解上界,允许分别训练每个专家,从而为MoE提供了一种鲁棒的优化方案。VDD在九个复杂的行为学习任务中证明,它能够:i) 准确蒸馏扩散模型学习到的复杂分布,ii) 优于现有的最先进蒸馏方法,以及iii) 超越训练MoE的传统方法。

关键词

引用

@article{arxiv.2406.12538,
  title  = {Variational Distillation of Diffusion Policies into Mixture of Experts},
  author = {Hongyi Zhou and Denis Blessing and Ge Li and Onur Celik and Xiaogang Jia and Gerhard Neumann and Rudolf Lioutikov},
  journal= {arXiv preprint arXiv:2406.12538},
  year   = {2024}
}

备注

Accepted by the 38th Annual Conference on Neural Information Processing Systems,