中文

MoE-DP:一种面向机器人长期操作的 MoE 增强扩散政策

机器人学 2025-11-10 v1

摘要

扩散政策已成为机器人视觉运动控制的强大框架,但它们往往缺乏鲁棒性,难以在长期、多阶段任务中从子任务失败中恢复,且学习到的观察表示往往难以解释。在本工作中,我们提出了 Mixture of Experts 增强扩散政策 (MoE-DP),核心思想是将 Mixture of Experts (MoE) 层插入视觉编码器和扩散模型之间。这一层将政策的知识分解为一组专门的专家,这些专家被动态激活以处理任务的不同阶段。我们通过大量实验表明,MoE-DP 在应对干扰方面具有强大的恢复能力,在鲁棒性方面显著优于标准基线。在 6 个长期仿真任务中,这导致在受干扰条件下的成功率平均提高了 36%。这种增强鲁棒性在实际应用中也得到了验证,MoE-DP 还显示出显著的性能提升。我们进一步表明,MoE-DP 学习到一种可解释的技能分解,其中不同的专家对应于语义任务原语(例如:接近、抓取)。这种学习到的结构可用于推理时控制,允许在不重新训练的情况下重新排列子任务。我们的视频和代码均可在 https://moe-dp-website.github.io/MoE-DP-Website/ 访问。

关键词

引用

@article{arxiv.2511.05007,
  title  = {MoE-DP: An MoE-Enhanced Diffusion Policy for Robust Long-Horizon Robotic Manipulation with Skill Decomposition and Failure Recovery},
  author = {Baiye Cheng and Tianhai Liang and Suning Huang and Maanping Shao and Feihong Zhang and Botian Xu and Zhengrong Xue and Huazhe Xu},
  journal= {arXiv preprint arXiv:2511.05007},
  year   = {2025}
}