中文

LAR-MoE:面向机器人仿真学习的潜在对齐路由混合专家

机器人学 2026-03-10 v1

摘要

仿真学习使机器人能够从演示中获取操纵技能,但跨任务部署仍具有挑战性,因为模型倾向于对演示中存在的不同行为模式进行平均。混合专家 (MoE) 架构通过激活专门的子网络来解决此问题,但需要有意义的技能分解才能实现专家路由。我们引入潜在对齐路由的混合专家 (LAR-MoE),是一个两阶段框架,将无监督技能发现与策略学习分离。在预训练阶段,我们通过学生-教师协训练学习观察与未来动作之间的联合潜在表示。在后训练阶段,通过正则化专家路由以遵循所学潜在空间的结构,防止专家崩溃,同时保持参数效率。我们在仿真环境和硬件平台上评估了LAR-MoE。在LIBERO基准测试中,我们的方法实现了95.2%的平均成功率,仅使用1.5亿参数。在一项手术肠道抓取和拉回任务中,LAR-MoE在不要求任何阶段标注的情况下,匹配了受监督的MoE基线,并实现了对体外猪组织的零样本迁移。我们的发现表明,潜在对齐路由为无监督技能分解提供了原则性的替代方案,使专家从无标签演示中实现结构化的专家专业化。

关键词

引用

@article{arxiv.2603.08476,
  title  = {LAR-MoE: Latent-Aligned Routing for Mixture of Experts in Robotic Imitation Learning},
  author = {Ariel Rodriguez and Chenpan Li and Lorenzo Mazza and Rayan Younis and Ortrun Hellig and Sebastian Bodenstedt and Martin Wagner and Stefanie Speidel},
  journal= {arXiv preprint arXiv:2603.08476},
  year   = {2026}
}

备注

Submitted to iROS 2026