中文

WOMD-Reasoning:基于交通法规驱动的驾驶场景交互推理大规模数据集

机器人学 2025-05-27 v3

摘要

语言模型因从文本预训练中积累的无限知识,在分析驾驶情景方面展现出前所未有的能力。尤其擅长分析基于规则的交互,如由交通法规触发的情形,这些情形在文本中有着详尽记录。然而,由于缺乏针对这一内容的专门语言数据集,此类交互分析仍未得到充分探索。因此,我们提出了基于Waymo Open Motion Dataset构建的交互推理数据集WOMD-Reasoning(Waymo Open Motion Dataset-Reasoning),该数据集聚焦于描述和推理驾驶场景中由交通法规引发的交互。WOMD-Reasoning目前已构建最规模的多模态问答数据集,包含300万条关于真实驾驶情景的问答,涵盖从地图描述、运动状态描述到代理人交互、行为与意图的叙述与分析等广泛驾驶主题。为展示WOMD-Reasoning的应用,我们设计了基于WOMD-Reasoning微调的Motion-LLaVA模型。在WOMD-Reasoning数据集及Motion-LLaVA输出方面进行定量与定性评估,验证了数据质量及其广泛应用潜力,包括交互预测、交通法规合规规划等。数据集及其视觉模态扩展已发布于https://waymo.com/open/download/。构建该数据集的代码与提示词已发布于https://github.com/yhli123/WOMD-Reasoning。

关键词

引用

@article{arxiv.2407.04281,
  title  = {WOMD-Reasoning: A Large-Scale Dataset for Interaction Reasoning in Driving},
  author = {Yiheng Li and Cunxin Fan and Chongjian Ge and Zhihao Zhao and Chenran Li and Chenfeng Xu and Huaxiu Yao and Masayoshi Tomizuka and Bolei Zhou and Chen Tang and Mingyu Ding and Wei Zhan},
  journal= {arXiv preprint arXiv:2407.04281},
  year   = {2025}
}