中文

面向自动驾驶的交互式增强驾驶数据集

计算机视觉与模式识别 2026-02-25 v1

摘要

向完全自动化驾驶演进要求具备鲁棒的交互能力;然而,Vision-Language-Action(VLA)模型的开发受限于现有数据中交互情境的稀疏性和不充分的多模态对齐。为此,本文提出了 Interactive Enhanced Driving Dataset(IEDD)。我们构建了 scalable pipeline,从自然驾驶数据中基于 interactive trajectories 挖掘出百万级交互片段,并设计度量指标来量化交互过程。进一步,构建 IEDD-VQA 数据集,通过生成合成 Bird's Eye View(BEV)视频,确保语义动作与结构化语言严格对齐。提供对十大主流 Vision Language Models(VLMs)的基准评估结果,旨在展示数据集在评估和微调自动驾驶模型推理能力方面的数据重用价值。

关键词

引用

@article{arxiv.2602.20575,
  title  = {An interactive enhanced driving dataset for autonomous driving},
  author = {Haojie Feng and Peizhi Zhang and Mengjie Tian and Xinrui Zhang and Zhuoren Li and Junpeng Huang and Xiurong Wang and Junfan Zhu and Jianzhou Wang and Dongxiao Yin and Lu Xiong},
  journal= {arXiv preprint arXiv:2602.20575},
  year   = {2026}
}