DiffVLA++:通过度量引导对齐构建认知推理与端到端驾驶的桥梁
机器人学
2025-11-05 v4 计算机视觉与模式识别
摘要
传统的端到端(E2E)驾驶模型在生成物理上合理的轨迹方面有效,但往往因缺乏理解和推理周围环境所必需的世界知识而难以泛化到长尾场景。相比,视觉语言动作(VLA)模型利用世界知识处理具有挑战性的情况,但其有限的3D推理能力可能导致产生不可行的动作。本文引入DiffVLA++——一种增强型自动驾驶框架,通过度量引导对齐显式地桥接认知推理与E2E规划。首先,我们构建VLA模块直接生成语义上具备 grounding 的驾驶轨迹。其次,我们设计具备稠密轨迹词汇表的E2E模块,确保物理可行性。最关键的是,我们引入度量引导轨迹评分器,以引导并对齐VLA与E2E模块的输出,从而整合两者的互补优势。在ICCV 2025 Autonomous Grand Challenge比赛板上进行实验,DiffVLA++实现了49.12的EPDMS分数。
引用
@article{arxiv.2510.17148,
title = {DiffVLA++: Bridging Cognitive Reasoning and End-to-End Driving through Metric-Guided Alignment},
author = {Yu Gao and Anqing Jiang and Yiru Wang and Wang Jijun and Hao Jiang and Zhigang Sun and Heng Yuwen and Wang Shuo and Hao Zhao and Sun Hao},
journal= {arXiv preprint arXiv:2510.17148},
year = {2025}
}