中文

基于 CLIP 和多头注意力的视频片头和片尾自动检测

计算机视觉与模式识别 2025-04-15 v1 人工智能 机器学习 多媒体

摘要

检测视频中片头/片尾与主内容之间的转换对于内容分段、索引和推荐系统至关重要。手动标注此类转换点耗时且容易出错,而基于启发式的方法往往难以在多样化的视频风格中泛化。在本工作中,我们引入了一种基于深度学习的方法,将问题形式化为序列到序列分类任务,对视频的每个秒数标记为“片头”或“电影”。该方法以固定帧率(1 FPS)提取帧,使用 CLIP(Contrastive Language-Image Pretraining)对其进行编码,并使用包含学习位置编码的多头注意力模型处理 resulting feature representations。该系统在测试集上实现了 91.0% 的 F1 分数、89.0% 的精确率和 97.0% 的召回率,并且针对实时推理进行了优化,在 CPU 上实现 11.5 FPS,在高端 GPU 上实现 107 FPS。该方法在自动内容索引、精彩检测和视频摘要等方面具有实际应用价值。未来工作将探索多模态学习,纳入音频特征和字幕,以进一步提高检测准确率。

关键词

引用

@article{arxiv.2504.09738,
  title  = {Automatic Detection of Intro and Credits in Video using CLIP and Multihead Attention},
  author = {Vasilii Korolkov and Andrey Yanchenko},
  journal= {arXiv preprint arXiv:2504.09738},
  year   = {2025}
}

备注

22 pages, 11 figures, submitted as a preprint. ArXiv preprint only, not submitted to a journal yet