中文

利用生成式 AI 结合事件与上下文信息的视频摘要

计算机视觉与模式识别 2025-01-10 v1 多媒体

摘要

视频内容制作的激增导致了海量数据,在分析效率和资源利用方面带来了巨大挑战。解决这一问题需要开发鲁棒的视频分析工具。本文提出了一种利用生成式人工智能(GenAI)的新方法,以促进简化的视频分析。我们的工具旨在提供针对用户定义查询的定制化文本摘要,在庞大的视频数据集中提供有针对性的洞察。不同于提供通用摘要或有限动作识别的传统框架,我们的方法利用 GenAI 的能力来提炼相关信息,提高了分析的精度和效率。我们的解决方案采用 YOLO-V8 进行目标检测,并采用 Gemini 进行全面的视频与文本分析,实现了更高的上下文准确度。通过将 YOLO 与 Gemini 相结合,我们的方法提供了从大量 CCTV 录像中提取的文本摘要,使用户能够快速导航并验证相关事件,而无需进行详尽的人工审查。定量评估显示其相似度为 72.8%,而定性评估的准确率得分为 85%,证明了所提方法的能力。

关键词

引用

@article{arxiv.2501.04764,
  title  = {Video Summarisation with Incident and Context Information using Generative AI},
  author = {Ulindu De Silva and Leon Fernando and Kalinga Bandara and Rashmika Nawaratne},
  journal= {arXiv preprint arXiv:2501.04764},
  year   = {2025}
}