DriveXQA:针对恶劣驾驶场景的跨模态视觉问答
计算机视觉与模式识别
2026-03-26 v2
摘要
融合具有互补模态的传感器对于维持对异常驾驶场景的稳定和全面理解至关重要。然而,多模态大语言模型(MLLMs)在利用多传感器信息来理解自动驾驶车辆中的恶劣驾驶场景方面仍受到忽视。为此,我们提出了 DriveXQA,一个用于自动驾驶 VQA 的多模态数据集。除了四种视觉模态、五种传感器故障情形和五种天气条件外,还包括 对 QA 对,分为三类:全局场景层级、allocentric 层级和以 ego-vehicle 为中心的层级。由于没有现有的 MLLM 框架将多个互补视觉模态作为输入,因此我们设计了 MVX-LLM,一个具有双向交叉注意力(DCA)投影器的 token 高效架构,用于融合模态以缓解信息冗余。实验表明,我们的 DCA 在恶劣条件下(如雾天)实现了改进的性能(GPTScore: 对照 )。
引用
@article{arxiv.2603.11380,
title = {DriveXQA: Cross-modal Visual Question Answering for Adverse Driving Scene Understanding},
author = {Mingzhe Tao and Ruiping Liu and Junwei Zheng and Yufan Chen and Kedi Ying and M. Saquib Sarfraz and Kailun Yang and Jiaming Zhang and Rainer Stiefelhagen},
journal= {arXiv preprint arXiv:2603.11380},
year = {2026}
}
备注
Accepted to CVPR DriveX Workshop. Dataset and Code: https://github.com/jtjmd/DRIVEXQA