D2-V2X:面向自动驾驶的深度驱动协同车联网推理
计算机视觉与模式识别
2026-05-26 v1
摘要
单车视觉语言模型从根本上受到传感器遮挡的限制。虽然车联网系统缓解了这一问题,但当前的基准测试缺乏解决复杂环境中歧义所需的协同推理。我们引入了D2-V2X,一个空间感知的问题-推理-答案基准测试,包含来自多模态车辆和基础设施传感器的8500个三元组。我们还建立了一个基线,将3D激光雷达特征与视觉语言模型的潜在空间对齐。通过在结构化JSON输出之前强制进行自然语言思维链推理,我们的模型被迫明确阐述空间关系。我们的实验表明,将视觉语言模型基于协同激光雷达,在识别被遮挡的危险方面实现了24.4%的召回率,而零样本模型接近零;并将可见物体的空间估计误差相比零样本基线降低了77%。虽然该模型达到了53.5的功能性决策F1分数,但我们确定3D到2D投影是当前视觉语言模型架构中的一个基本瓶颈,为未来的创新建立了新的基线。数据、代码和训练好的模型可在https://github.com/KevinRichard1/D2-V2X获取。
引用
@article{arxiv.2605.24098,
title = {D2-V2X: Depth-Driven Cooperative V2X Reasoning for Autonomous Driving},
author = {Kevin Richard and Alphin Varghese and Colin Pham and David Oh and Srijan Das},
journal= {arXiv preprint arXiv:2605.24098},
year = {2026}
}
备注
Accepted to the DriveX Workshop at CVPR 2026 (Non-archival)