中文

基于大模型的序列关键帧提取用于视频摘要

计算机视觉与模式识别 2024-01-11 v1

摘要

关键帧提取旨在用最少数量的帧概括视频的语义。本文提出一种基于大模型的序列关键帧提取方法用于视频摘要,简称 LMSKE,包含以下三个阶段。首先,我们使用大模型“TransNetV21”将视频切割为连续的镜头,并利用大模型“CLIP2”生成每个镜头内每一帧的视觉特征;其次,我们开发了一种自适应聚类算法,为每个镜头生成候选关键帧,每个候选关键帧位于最靠近聚类中心的位置;第三,我们通过镜头内冗余消除进一步精简上述候选关键帧,最后按照镜头顺序将它们串联起来作为最终的序列关键帧。为评估 LMSKE,我们整理了一个基准数据集并进行了丰富的实验,结果表明 LMSKE 的性能远优于众多 SOTA 竞争对手,平均 F1 值为 0.5311,平均保真度为 0.8141,平均压缩比为 0.9922。

关键词

引用

@article{arxiv.2401.04962,
  title  = {Large Model based Sequential Keyframe Extraction for Video Summarization},
  author = {Kailong Tan and Yuxiang Zhou and Qianchen Xia and Rui Liu and Yong Chen},
  journal= {arXiv preprint arXiv:2401.04962},
  year   = {2024}
}

备注

This paper has been accepted for CDIVP 2024