中文

OmniDrive:基于反事实推理的自主驾驶综合视觉-语言数据集

计算机视觉与模式识别 2025-04-17 v2

摘要

视觉-语言模型(VLM)的进步导致越来越多的研究关注如何在自主驾驶中利用其强大的推理能力。然而,将这些能力从二维扩展到完整的三维理解对于现实应用至关重要。为此,我们提出OmniDrive,一个通过反事实推理将代理模型与3D驾驶任务对齐的综合视觉-语言数据集。这种方法通过评估潜在情景及其结果来增强决策,类似于人类驾驶员考虑替代动作。我们的基于反事实的合成数据标注过程生成大规模高质量数据集,提供更密集的监督信号,将规划轨迹与语言推理相连。进一步,我们探索了两种先进的OmniDrive-Agent框架,即Omni-L和Omni-Q,用于评估视觉-语言对齐与3D感知的重要性,揭示了设计有效LLM代理的关键见解。显著的改进在DriveLM Q&A基准和nuScenes开放式规划中证明了我们数据集和方法的有效性。

关键词

引用

@article{arxiv.2405.01533,
  title  = {OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning},
  author = {Shihao Wang and Zhiding Yu and Xiaohui Jiang and Shiyi Lan and Min Shi and Nadine Chang and Jan Kautz and Ying Li and Jose M. Alvarez},
  journal= {arXiv preprint arXiv:2405.01533},
  year   = {2025}
}