中文

大模型下的犯罪监控视频分析基准

计算机视觉与模式识别 2025-02-14 v1

摘要

监控视频中的异常分析是计算机视觉中的一个关键议题。近年来, 多模态大语言模型(MLLM)在各个领域超越了特定任务模型。虽然MLLM特别灵活, 但其理解异常概念和细节的能力不足, 因为该领域的现有基准未能提供MLLM风格的问答和高效评估模型开放式文本响应的方法。为填补这一空白, 我们提出了一个用于犯罪监控视频分析的大模型基准, 称为UCVL, 包括1829个视频并重新组织来自UCF-Crime和UCF-Crime Annotation数据集的注释。我们设计六种问题类型并生成多样化的问答对。然后我们开发详细的指令并使用OpenAI的GPT-4o进行准确评估。我们对八个主流MLLM进行基准测试, 参数规模从0.5B到40B, 结果表明本基准的可靠性。此外, 我们在UCVL的训练集上微调了LLaVA-OneVision。所得改进验证了我们数据的高质量, 适用于视频异常分析。

关键词

引用

@article{arxiv.2502.09325,
  title  = {A Benchmark for Crime Surveillance Video Analysis with Large Models},
  author = {Haoran Chen and Dong Yi and Moyan Cao and Chensen Huang and Guibo Zhu and Jinqiao Wang},
  journal= {arXiv preprint arXiv:2502.09325},
  year   = {2025}
}