InterAct-Video:面向城市交通的推理增强视频问答
计算机视觉与模式识别
2025-08-29 v3
摘要
交通监控是城市 mobility、道路安全以及智能交通系统(ITS)的关键环节。深度学习通过视频问答(VideoQA)模型推动了基于视频的交通监控,使可从交通视频中提取结构化洞察。然而,现有 VideoQA 模型在处理真实世界交通场景的复杂性时难以为力——这些场景中存在多个在时空维度上并行发生的事件。为此,本文提出 \textbf{InterAct VideoQA},一个为提升和评估交通监控任务中的 VideoQA 模型而构建的精选数据集。InterAct VideoQA 数据集包含来自多样化交叉口的 8 小时真实交通影像,划分为 10 秒视频片段,包含超过 25000 组问答(QA)对,涵盖时空动力学、车辆相互作用、事故检测及其他关键交通属性。对最新 VideoQA 模型在 InterAct VideoQA 上的评估暴露了在复杂交通情境中处理细粒度时空依赖推理的挑战。此外,对这些模型在 InterAct VideoQA 上的微调可显著提升性能,表明特定于领域的数据集对 VideoQA 的必要性。InterAct VideoQA 已公开提供,以作为基准数据集推动未来在智能交通系统中可部署 VideoQA 模型的研究。GitHub 仓库:https://github.com/joe-rabbit/InterAct_VideoQA
引用
@article{arxiv.2507.14743,
title = {InterAct-Video: Reasoning-Rich Video QA for Urban Traffic},
author = {Joseph Raj Vishal and Divesh Basina and Rutuja Patil and Manas Srinivas Gowda and Katha Naik and Yezhou Yang and Bharatesh Chakravarthi},
journal= {arXiv preprint arXiv:2507.14743},
year = {2025}
}