VDT-Auto:基于 VLM 指导的扩散 Transformer 实现端到端自动驾驶
计算机视觉与模式识别
2025-03-04 v2 机器人学
摘要
在自动驾驶领域,动态环境和棘手情形对自主车辆决策的鲁棒性构成了显著挑战。为此,我们首先从状态-动作映射表示开始,引入一种新型管道,VDT-Auto。利用视觉语言模型(VLM)在状态理解方面的进展,并结合基于扩散 Transformer 的动作生成,我们的 VDT-Auto 从几何和语境两个维度对环境进行解析,以作为扩散过程的条件。从几何上,我们使用鸟瞰图(BEV)编码器从周围图像中提取特征网格。从语境上,我们处理我们微调的 VLM 的结构化输出,生成文本嵌入和噪声路径。在扩散过程中,前向过程的噪声来自微调的 VLM 的噪声路径输出,而提取的 BEV 特征网格和嵌入文本则作为扩散 Transformer 逆过程的条件。我们的 VDT-Auto 在 nuScenes 开放环规划评估中实现了平均 0.52m 的 L2 误差和 21% 的平均碰撞率。此外,实际场景演示表明,VDT-Auto 在一般化方面表现突出。代码和数据集将在接受后公开。
引用
@article{arxiv.2502.20108,
title = {VDT-Auto: End-to-end Autonomous Driving with VLM-Guided Diffusion Transformers},
author = {Ziang Guo and Konstantin Gubernatorov and Selamawit Asfaw and Zakhar Yagudin and Dzmitry Tsetserukou},
journal= {arXiv preprint arXiv:2502.20108},
year = {2025}
}
备注
Submitted paper