WTS:面向细粒度时空理解的面向行人交通视频数据集
计算机视觉与模式识别
2024-07-23 v1
摘要
本文解决了在交通场景中进行细粒度视频事件理解的挑战,这对于自动驾驶和安全至关重要。传统数据集关注司机或车辆行为,常常忽视行人的视角。为填补这一空白,我们介绍了WTS数据集,突出显示数千个交通场景中车辆和行人的详细行为。WTS集成了来自车辆自身和固定俯瞄摄像头的多样化视角,在车辆-基础设施合作环境中,丰富了详细的文本描述和独特的3D凝视数据,以同步的2D/3D视图为焦点,关注行人分析。我们还提供了5k个公开来源的行人相关交通视频的标注。此外,我们引入了LLMScorer,这是一种基于LLM的评估指标,用于对推断标题与真实值进行对齐。使用WTS,我们为稠密视频到文本任务建立了基准,探索了领先的视觉-语言模型,并以一种基于实例的方法的VideoLLM作为基线。WTS旨在推动细粒度视频事件理解的发展,增强交通安全和自动驾驶的发展。
引用
@article{arxiv.2407.15350,
title = {WTS: A Pedestrian-Centric Traffic Video Dataset for Fine-grained Spatial-Temporal Understanding},
author = {Quan Kong and Yuki Kawana and Rajat Saini and Ashutosh Kumar and Jingjing Pan and Ta Gu and Yohei Ozao and Balazs Opra and David C. Anastasiu and Yoichi Sato and Norimasa Kobori},
journal= {arXiv preprint arXiv:2407.15350},
year = {2024}
}
备注
ECCV24. Website: https://woven-visionai.github.io/wts-dataset-homepage/