VECTOR-Drive:面向 end-to-end 自动驾驶的紧耦合视觉语言与轨迹专家路由
计算机视觉与模式识别
2026-05-20 v2 人工智能
机器人学
摘要
end-to-end 自动驾驶需要模型理解交通场景、推断驾驶意图并生成可执行的运动计划。最近的视觉语言-动作(VLA)模型继承了大规模视觉语言预训练的语义先验,但仍面临耦合权衡:完全共享 backbone 保留多模态交互但可能 entangled 语言推理与轨迹预测;解耦推理-动作管线减少任务冲突但削弱语义-运动耦合。我们提出 VECTOR-DRIVE,基于 Qwen2.5-VL-3B 的紧耦合 VLA 框架。VECTOR-DRIVE 通过共享自注意力保持所有 token 紧耦合,并根据 token 语义路由 feed-forward 计算。视觉和语言 token 由 Vision-Language Expert 处理以保留语义先验,而目标点、ego-state 和噪声动作 token 路由到 Trajectory Expert 进行运动专用计算。在动作 token 路径上,flow-matching planner 将噪声动作 token 细化为未来路点和速度轮廓。该设计在单一多模态 Transformer 中耦合语义推理与运动规划,同时分离任务特定 FFN 计算。在 Bench2Drive 上,VECTOR-DRIVE 获得 88.91 分的驾驶得分,优于代表性 end-to-end 和 VLA 基线。定性结果和消融实验进一步验证了共享注意力、语义感知专家路由、渐进训练和 flow-based action 解码的优势。
引用
@article{arxiv.2605.08830,
title = {VECTOR-Drive: Tightly Coupled Vision-Language and Trajectory Expert Routing for End-to-End Autonomous Driving},
author = {Rui Zhao and Jianlin Yu and Zhenhai Gao and Jiaqiao Liu and Fei Gao},
journal= {arXiv preprint arXiv:2605.08830},
year = {2026}
}