MindVLA-U1:统一流式架构下的 VLA 超越 VA 实现自动驾驶
摘要
自动驾驶正从模块化管道向端到端统一化发展,Vision-Language-Action(VLA)模型是这一旅程的自然延伸,超越 Vision-to-Action(VA)。在实际应用中,驾驶 VLA 常在规划质量上落后于 VA,表明困难不仅仅是模型规模,而是语义推理、时序上下文和连续控制相结合的接口方式。我们认为,这一差距反映了 VLA 的构建方式——作为孤立子任务改进,无法组合出连贯的驾驶能力——而非 VLA 本身。我们提出了 MindVLA-U1,这是首个用于自动驾驶的统一流式 VLA 架构。统一的 VLM 主干在单次前向传播中产生 AR 语言 token(可选)和流匹配连续动作轨迹,保留每种模态的自然输出形式。全流式设计以帧为单位处理驾驶视频,而非作为固定视频-动作块,在高昂的时序 VLM 建模下。计划轨迹在帧之间平滑演化,学习的流式记忆通道携带时序上下文并更新。统一架构通过灵活的自注意力上下文管理支持快速/缓慢系统于稠密/稀疏 MoT 主干,并暴露可衡量的语言-控制路径:语言预测的驾驶意图通过 classifier-free guidance(CFG)驱动动作扩散,将语言侧意图转化为连续动作规划的控制信号。在长尾 WOD-E2E 数据集上,MindVLA-U1 首次超越经验丰富的类人驾驶员(8.20 RFS vs. 8.13 GT RFS),仅需 2 步扩散即可实现 state-of-the-art 规划 ADEs,并在保持自然语言界面以进行人机-vehicle 交互的同时,将 VA 延迟匹配(16 FPS vs. RAP 的 18 FPS 在 1B 规模下)。
引用
@article{arxiv.2605.12624,
title = {MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving},
author = {Yuzhou Huang and Benjin Zhu and Hengtong Lu and Victor Shea-Jay Huang and Haiming Zhang and Wei Chen and Jifeng Dai and Yan Xie and Hongsheng Li},
journal= {arXiv preprint arXiv:2605.12624},
year = {2026}
}
备注
Work in progress. Project page: https://mind-omni.github.io/