中文

SurveillanceVQA-589K:面向大模型的综合 Surveillance 视频语言理解基准

计算机视觉与模式识别 2025-05-20 v1

摘要

理解监控视频内容仍是视觉语言研究中critical且未被充分探索的挑战,尤其鉴于其真实世界的复杂性、不规则的事件动态以及安全关键性。本工作引入 SurveillanceVQA-589K,为监控领域量身定制的最大规模开放式视频问答基准。该数据集涵盖 589,380 对 QA 配对,覆盖 12 种认知上多样化的问答类型,包括时间推理、因果推断、空间理解和异常解释,涵盖正常和异常视频情景。为大规模构建基准,我们设计了混合标注流程,将时序对齐的人工撰写描述与大型视觉语言模型辅助的 QA 生成相结合,采用提示技术。我们还提出了多维评估协议,以评估情境、时间和因果理解。我们在该框架下评估了八个大型视觉语言模型(LVLMs),揭示了在因果和异常相关任务上的显著性能差距,凸显了当前模型在真实世界监控情境中的局限性。我们的基准为发展面向智能监控、事件分析和自主决策等安全关键型应用的视频语言理解提供了实用且全面的资源。

关键词

引用

@article{arxiv.2505.12589,
  title  = {SurveillanceVQA-589K: A Benchmark for Comprehensive Surveillance Video-Language Understanding with Large Models},
  author = {Bo Liu and Pengfei Qiao and Minhan Ma and Xuange Zhang and Yinan Tang and Peng Xu and Kun Liu and Tongtong Yuan},
  journal= {arXiv preprint arXiv:2505.12589},
  year   = {2025}
}

备注

The dataset and code are publicly available at: https://huggingface.co/datasets/fei213/SurveillanceVQA-589K