面向自动驾驶的场景自适应混合专家视觉-语言-动作模型:SAMoE-VLA
计算机视觉与模式识别
2026-03-10 v1
摘要
近期视觉-语言-动作 (VLA) 模型的进展显示出在自动驾驶中利用大型语言模型 (LLM) 理解与推理能力的前景。然而,我们的经验分析揭示,直接将现有基于标记的混合专家机制 — — 源自 LLM 架构 — — 应用于 VLA 模型会导致性能不稳定和安全性能下降,这凸显了基于标记的专家专化与场景级决策之间的偏差。为此,我们提出 SAMoE-VLA,一个场景自适应视觉-语言-动作框架,条件化 expert selection 基于结构化场景表示而非标记嵌入。我们的核心思想是从鸟瞰视角 (BEV) 特征中派生混合专家路由信号,该特征封装了交通场景上下文,使场景相关的 expert 加权和合并能够针对不同驾驶条件进行优化。此外,为支持跨世界知识、感知、语言和动作的时序一致推理,我们引入条件跨模态因果注意力机制,将世界状态、语言意图和动作历史整合为统一的因果推理过程。广泛实验在 nuScenes 开放式规划数据集和 LangAuto 闭环基准上表明,SAMoE-VLA 实现了最先进的性能,凭借更少的参数 outperform 之前的 VLA 及世界模型方法。我们的代码将很快公开。
引用
@article{arxiv.2603.08113,
title = {SAMoE-VLA: A Scene Adaptive Mixture-of-Experts Vision-Language-Action Model for Autonomous Driving},
author = {Zihan You and Hongwei Liu and Chenxu Dang and Zhe Wang and Sining Ang and Aoqi Wang and Yan Wang},
journal= {arXiv preprint arXiv:2603.08113},
year = {2026}
}