面向自动驾驶的全景视觉语言数据集 OmniDrive 及其反事实推理
计算机视觉与模式识别
2025-04-17 v2
摘要
视觉语言模型 (VLM) 的不断进步导致越来越多的关注力度转向自动驾驶,以利用其强大的推理能力。然而,将这些能力从 2D 扩展到完整的 3D 理解对于实际应用至关重要。为此,我们提出 OmniDrive,一个通过反事实推理将 agent 模型与 3D 驾驶任务对齐的全景视觉语言数据集。该方法通过评估潜在情景及其结果来增强决策,就像人类驾驶员会考虑替代行动一样。我们的反事实驱动的合成数据标注过程生成大规模高质量数据集,提供更密集的监督信号,将规划轨迹与基于语言的推理相连。进一步,我们探讨了两种先进的 OmniDrive-Agent 框架,即 Omni-L 和 Omni-Q,用于评估视觉语言对齐性与 3D 感知的重要性,揭示了设计有效 LLM-agents 的关键见解。在 DriveLM Q&A 基准和 nuScenes 开放式规划上均取得显著改进,证明了我们数据集和方法的有效性。
关键词
引用
@article{arxiv.2504.04348,
title = {OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning},
author = {Shihao Wang and Zhiding Yu and Xiaohui Jiang and Shiyi Lan and Min Shi and Nadine Chang and Jan Kautz and Ying Li and Jose M. Alvarez},
journal= {arXiv preprint arXiv:2504.04348},
year = {2025}
}
备注
Mistaken resubmission. The original version is at arXiv:2405.01533