中文

TB-Bench:基于 Dashcam 图像/视频理解时空交通行为的多模态 AI 训练与测试基准

计算机视觉与模式识别 2025-01-13 v1

摘要

多模态大语言模型(MLLM)在自动驾驶(AD)中的应用面临显著挑战:其在交通专用数据上的训练有限,且缺乏专门用于时空理解的基准测试。为此本研究提出TB-Bench,一个全面基准,用于评估MLLM对ego视角下交通行为的理解,涵盖八个感知任务。我们还引入视觉语言指令调谋数据集TB-100k和TB-250k,并提供简单且有效的基线方法。通过大量实验,我们表明现有MLLM在这些任务上表现不佳,即使是强大的GPT-4o模型在平均准确率上也不到35%。相比之下,采用TB-100k或TB-250k微调后,我们的基线模型在平均准确率可达85%,显著提升了任务性能。此外,我们演示了通过在TB-100k与另一个交通数据集共训练,实现对后者性能的提升。总体而言,本研究通过引入全面基准、高质量数据集和基线方法,为MLLM在自动驾驶感知、预测和规划阶段的渐进集成提供了支持。

关键词

引用

@article{arxiv.2501.05733,
  title  = {TB-Bench: Training and Testing Multi-Modal AI for Understanding Spatio-Temporal Traffic Behaviors from Dashcam Images/Videos},
  author = {Korawat Charoenpitaks and Van-Quang Nguyen and Masanori Suganuma and Kentaro Arai and Seiji Totsuka and Hiroshi Ino and Takayuki Okatani},
  journal= {arXiv preprint arXiv:2501.05733},
  year   = {2025}
}

备注

Main Paper: 8 pages, Supplementary Materials: 15 pages