一种低计算量的视频摘要框架及标准数据集
计算机视觉与模式识别
2024-09-10 v1
摘要
视频摘要是浓缩监控视频的有效方法。该技术首先检测和跟踪目标,然后创建目标管。这些管由序列组成,每个序列包含一个唯一目标按时间顺序排列的边界框。为了生成浓缩视频,第一步是重新排列目标管,以最大化每帧中非重叠目标的数量。然后,将这些管拼接至从源视频中提取的背景图像上。视频摘要任务缺乏标准数据集阻碍了不同视频摘要模型的比较。本文通过引入一个专为视频摘要任务设计的标准数据集SynoClip来解决这一问题。SynoClip包含了直接有效评估各种模型所需的所有必要特征。此外,本工作还引入了一个计算成本低的视频摘要模型FGS。该模型包含一个空帧目标检测器,用于识别没有任何目标的帧,从而促进深度目标检测器的高效利用。此外,还提出了一种管分组算法,以维持合成视频中管之间的关系。随后是一个贪婪管重排算法,该算法高效地确定每个管的起始时间。最后,使用所提出的数据集对所提出的模型进行了评估。源代码、微调后的目标检测模型和教程可在https://github.com/Ramtin-ma/VideoSynopsis-FGS获取。
引用
@article{arxiv.2409.05230,
title = {A Low-Computational Video Synopsis Framework with a Standard Dataset},
author = {Ramtin Malekpour and M. Mehrdad Morsali and Hoda Mohammadzade},
journal= {arXiv preprint arXiv:2409.05230},
year = {2024}
}
备注
13 pages, 8 figures