面向视频监控应用的大语言模型
计算机视觉与模式识别
2025-01-07 v1
摘要
视频内容的快速增长带来了海量数据,为高效分析与资源管理带来了重大挑战。为应对这一问题,亟需稳健的视频分析工具。本文提出了一种创新性的概念验证,采用生成式人工智能(Generative Artificial Intelligence, GenAI)形式中的视觉语言模型,以增强下游视频分析流程。我们的工具可根据用户自定义查询生成定制化的文本摘要,在海量视频数据集中提供聚焦的洞察。不同于提供通用摘要或有限动作识别的传统方法,我们的方法利用视觉语言模型提取相关信息,从而提升分析精度与效率。所提出的方法能够从大量 CCTV 监控视频中生成文本摘要,这些摘要可长期存储,且相比视频本身占用极小的存储空间,使用户无需进行穷尽式的人工审阅即可快速导航并核实重要事件。定性评估结果表明,该流程在时间质量、空间质量与一致性方面的准确率分别达到 80% 与 70%。
引用
@article{arxiv.2501.02850,
title = {Large Language Models for Video Surveillance Applications},
author = {Ulindu De Silva and Leon Fernando and Billy Lau Pik Lik and Zann Koh and Sam Conrad Joyce and Belinda Yuen and Chau Yuen},
journal= {arXiv preprint arXiv:2501.02850},
year = {2025}
}
备注
Accepted for TENCON 2024