EvoDriveVLA:通过协作感知-规划蒸馏演化驾驶 VLA 模型
计算机视觉与模式识别
2026-05-12 v3 人工智能
摘要
视觉-语言-动作(VLA)模型在自主驾驶领域展现出巨大潜力,但在解冻视觉编码器后感知性能会下降,且在长期规划中积累不稳定性。为解决这些挑战,我们提出 EvoDriveVLA——一种创新的协作感知-规划蒸馏框架,集成了自锚�感知约束和未来感知轨迹优化。具体而言,自锚视觉蒸馏利用自锚老师提供视觉锚定约束,通过轨迹引导的关键区域意识来正则化学生表示。在平行地,未来感知轨迹蒸馏采用未来感知的 oracle 老师,采用粗到细的轨迹细化和蒙特卡罗 dropout 采样,以合成模型未来演化的推理轨迹,使学生模型能够内化老师的未来感知见解。EvoDriveVLA 在 nuScenes open-loop 评估中实现了 SOTA 水平,在 NAVSIM closed-loop 评估中显著提升了性能。我们的代码可在 https://github.com/hey-cjj/EvoDriveVLA 获取。
引用
@article{arxiv.2603.09465,
title = {EvoDriveVLA: Evolving Driving VLA Models via Collaborative Perception-Planning Distillation},
author = {Jiajun Cao and Xiaoan Zhang and Xiaobao Wei and Liyuqiu Huang and Zijian Wang and Hanzhen Zhang and Zhengyu Jia and Wei Mao and Hao Wang and Xianming Liu and Shuchang Zhou and Yang Wang and Shanghang Zhang},
journal= {arXiv preprint arXiv:2603.09465},
year = {2026}
}
备注
19 pages, 5 figures, 5 tables