TUMTraffic-VideoQA:面向交通场景统一时空视频理解的基准数据集
计算机视觉与模式识别
2025-02-05 v1
摘要
我们提出了 TUMTraffic-VideoQA,这是一个新颖的数据集和基准,旨在用于复杂路侧交通场景中的时空视频理解。该数据集包含 1,000 个视频,拥有 85,000 个多项选择问答对、2,300 个目标描述和 5,700 个目标定位标注,涵盖了恶劣天气和交通异常等多种真实世界条件。通过引入基于元组的时空目标表达,TUMTraffic-VideoQA 在一个统一的评估框架内整合了三项基本任务:多项选择视频问答、指称目标描述和时空目标定位。我们进一步引入了 TUMTraffic-Qwen 基线模型,并通过视觉令牌采样策略对其进行了增强,为细粒度时空推理的挑战提供了宝贵的见解。大量实验证明了该数据集的复杂性,突显了现有模型的局限性,并将 TUMTraffic-VideoQA 定位为推动智能交通系统研究的坚实基础。该数据集和基准已公开,以促进进一步的探索。
引用
@article{arxiv.2502.02449,
title = {TUMTraffic-VideoQA: A Benchmark for Unified Spatio-Temporal Video Understanding in Traffic Scenes},
author = {Xingcheng Zhou and Konstantinos Larintzakis and Hao Guo and Walter Zimmer and Mingyu Liu and Hu Cao and Jiajie Zhang and Venkatnarayanan Lakshminarasimhan and Leah Strand and Alois C. Knoll},
journal= {arXiv preprint arXiv:2502.02449},
year = {2025}
}