中文

面向视频监控应用的大语言模型

计算机视觉与模式识别 2025-01-07 v1

摘要

视频内容的快速增长带来了海量数据,为高效分析与资源管理带来了重大挑战。为应对这一问题,亟需稳健的视频分析工具。本文提出了一种创新性的概念验证,采用生成式人工智能(Generative Artificial Intelligence, GenAI)形式中的视觉语言模型,以增强下游视频分析流程。我们的工具可根据用户自定义查询生成定制化的文本摘要,在海量视频数据集中提供聚焦的洞察。不同于提供通用摘要或有限动作识别的传统方法,我们的方法利用视觉语言模型提取相关信息,从而提升分析精度与效率。所提出的方法能够从大量 CCTV 监控视频中生成文本摘要,这些摘要可长期存储,且相比视频本身占用极小的存储空间,使用户无需进行穷尽式的人工审阅即可快速导航并核实重要事件。定性评估结果表明,该流程在时间质量、空间质量与一致性方面的准确率分别达到 80% 与 70%。

关键词

引用

@article{arxiv.2501.02850,
  title  = {Large Language Models for Video Surveillance Applications},
  author = {Ulindu De Silva and Leon Fernando and Billy Lau Pik Lik and Zann Koh and Sam Conrad Joyce and Belinda Yuen and Chau Yuen},
  journal= {arXiv preprint arXiv:2501.02850},
  year   = {2025}
}

备注

Accepted for TENCON 2024