UDVideoQA:基于城市动态中多目标时空推理的交通视频问答数据集
计算机视觉与模式识别
2026-02-25 v1
摘要
理解城市交通中复杂的多智能体动态仍是视频语言模型面临的根本挑战。本文引入城市动态视频问答(Urban Dynamics VideoQA),一个捕捉动态城市场景中非脚本化真实行为的基准数据集。UDVideoQA从多个城市交叉口在多样化交通、天气和光照条件下记录的16小时交通影像中筛选而来。数据集采用事件驱动的动态模糊技术,确保在保留场景真实性的同时实现隐私保护。采用统一的标注流程,数据集包含28K个问答对,覆盖8小时的密集标注视频,平均每秒一问。其分类体系遵循层次化推理级别,涵盖基础理解与归因、事件推理、逆向推理和反事实推理,系统评估视觉 grounding 与因果推理能力。全面实验对10个SOTA VideoLMs在UDVideoQA上进行基准测试,同时对8个模型在补充视频问答生成基准上进行测试。结果揭示了持久的感知-推理鸿沟,表明在抽象推理方面表现突出的模型往往在基本视觉 grounding 上表现不足。虽然Gemini Pro在零样本准确率最高,但在UDVideoQA上对较小规模的Qwen2.5-VL 7B模型进行微调,可实现与专有系统相当的性能。在VideoQGen中,Gemini 2.5 Pro、Qwen3 Max生成的最相关且最复杂的问题,但所有模型都表现出语言多样性有限,凸显了需要以人为中心进行评估的必要性。UDVideoQA套件包括数据集、标注工具以及用于VideoQA和VideoQGen的基准测试,为推动稳健的、隐私-aware的以及面向真实世界的多模态推理提供了基础。UDVideoQA可在 https://ud-videoqa.github.io/UD-VideoQA/UD-VideoQA/ 获取。
引用
@article{arxiv.2602.21137,
title = {UDVideoQA: A Traffic Video Question Answering Dataset for Multi-Object Spatio-Temporal Reasoning in Urban Dynamics},
author = {Joseph Raj Vishal and Nagasiri Poluri and Katha Naik and Rutuja Patil and Kashyap Hegde Kota and Krishna Vinod and Prithvi Jai Ramesh and Mohammad Farhadi and Yezhou Yang and Bharatesh Chakravarthi},
journal= {arXiv preprint arXiv:2602.21137},
year = {2026}
}