MoSE:面向具身自主机器的按技能混合专家学习
人工智能
2025-08-14 v2 计算机视觉与模式识别
机器学习
摘要
为了满足对更智能、更快速且更高效的具身 AI 解决方案日益增长的需求,我们引入了一种新型的混合专家方法,显著提升了具身自主系统的推理与学习效率。通用 MoE 模型需要大量训练数据和复杂的优化,这限制了其在自动驾驶和机器人操作等具身 AI 中的适用性。在本研究中,我们提出了一种名为 MoSE 的面向技能的 MoE,它逐个技能、逐步骤地模仿人类的学习与推理过程。我们引入了一种面向技能的路由机制,首先定义并标注特定技能,使专家能够识别各种场景和推理任务所需的能力,从而促进按技能学习。为了更好地与人类推理及端到端驾驶模型中的多步规划对齐,我们构建了层次化技能数据集并预训练路由器,以鼓励模型逐步思考。与其他多轮对话不同,MoSE 在单次前向过程中集成了有价值的辅助任务(例如自动驾驶的感知-预测-规划,以及机器人的高低层规划),且未引入任何额外计算成本。凭借少于 3B 的稀疏激活参数,我们的模型有效增长了更多样化的专业技能,并在自动驾驶极端案例推理任务和机器人推理任务上,以不到 40% 的参数量优于现有模型。
引用
@article{arxiv.2507.07818,
title = {MoSE: Skill-by-Skill Mixture-of-Experts Learning for Embodied Autonomous Machines},
author = {Lu Xu and Jiaqian Yu and Xiongfeng Peng and Yiwei Chen and Weiming Li and Jaewook Yoo and Sunghyun Chunag and Dongwook Lee and Daehyun Ji and Chao Zhang},
journal= {arXiv preprint arXiv:2507.07818},
year = {2025}
}