DriveMoE:面向端到端自动驾驶的视觉-语言-动作模型的混合专家
计算机视觉与模式识别
2026-05-19 v2 人工智能
机器人学
摘要
端到端自动驾驶(E2E-AD)需要有效处理多视图感知数据并稳健地处理多样化且复杂的驾驶场景,尤其是诸如激进转弯等稀有机动。近期混合专家(MoE)架构在大语言模型(LLM)中的成功,表明参数的专业化可实现强大的可扩展性。在本工作中,我们提出了 DriveMoE,一种新的基于 MoE 的 E2E-AD 框架,包含场景专化的视觉 MoE 和技能专化的动作 MoE。DriveMoE 建立在我们的 视觉-语言-动作(VLA)基线之上,该基线最初来自具身 AI 领域,称为 Drive-。具体而言,我们通过训练路由器在驾驶情境下动态选择相关摄像机来向 Drive- 添加视觉 MoE。这种设计模仿了人类驾驶认知,驾驶员会选择关注关键视觉线索,而不是详尽地处理所有视觉信息。此外,我们通过训练另一个路由器来激活针对不同驾驶行为的专用专家模块来添加动作 MoE。通过显式的行为专业化,DriveMoE 能够在不像现有模型那样出现模式平均化的情况下处理多样化场景。在 Bench2Drive 闭环评估实验中,DriveMoE 实现了最先进(SOTA)性能,证明了在自动驾驶任务中结合视觉和动作 MoE的有效性。我们将发布 DriveMoE 和 Drive-的代码和模型。
引用
@article{arxiv.2505.16278,
title = {DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving},
author = {Zhenjie Yang and Yilin Chai and Xiaosong Jia and Qifeng Li and Yuqian Shao and Xuekai Zhu and Haisheng Su and Junchi Yan},
journal= {arXiv preprint arXiv:2505.16278},
year = {2026}
}
备注
Accepted by CVPR 2026, Project Page: https://thinklab-sjtu.github.io/DriveMoE/