中文

面向世界模型在线模仿学习的耦合分布随机专家蒸馏

机器学习 2026-01-06 v2 人工智能

摘要

模仿学习(Imitation Learning, IL)通过使智能体从专家演示中学习复杂行为,在机器人、自动驾驶和医疗保健等多个领域取得了显著成功。然而,现有的 IL 方法常常面临不稳定性挑战,尤其是在世界模型框架中依赖对抗性奖励或价值函数公式时。在这项工作中,我们提出了一种新颖的在线模仿学习方法,通过基于随机网络蒸馏(Random Network Distillation, RND)进行密度估计的奖励模型来解决这些局限性。我们的奖励模型建立在世界模型潜在空间内专家分布和行为分布的联合估计之上。我们在包括 DMControl、Meta-World 和 ManiSkill2 在内的多种基准上评估了我们的方法,展示了其在运动和操作任务中提供稳定性能并达到专家级结果的能力。我们的方法在保持专家级性能的同时,相比对抗性方法表现出更高的稳定性。

关键词

引用

@article{arxiv.2505.02228,
  title  = {Coupled Distributional Random Expert Distillation for World Model Online Imitation Learning},
  author = {Shangzhe Li and Zhiao Huang and Hao Su},
  journal= {arXiv preprint arXiv:2505.02228},
  year   = {2026}
}

备注

NeurIPS 2025 Workshop of Embodied World Models; Code Available at: https://github.com/TobyLeelsz/CDRED-WM