基于 CLIP 和多头注意力的视频片头和片尾自动检测
计算机视觉与模式识别
2025-04-15 v1 人工智能
机器学习
多媒体
摘要
检测视频中片头/片尾与主内容之间的转换对于内容分段、索引和推荐系统至关重要。手动标注此类转换点耗时且容易出错,而基于启发式的方法往往难以在多样化的视频风格中泛化。在本工作中,我们引入了一种基于深度学习的方法,将问题形式化为序列到序列分类任务,对视频的每个秒数标记为“片头”或“电影”。该方法以固定帧率(1 FPS)提取帧,使用 CLIP(Contrastive Language-Image Pretraining)对其进行编码,并使用包含学习位置编码的多头注意力模型处理 resulting feature representations。该系统在测试集上实现了 91.0% 的 F1 分数、89.0% 的精确率和 97.0% 的召回率,并且针对实时推理进行了优化,在 CPU 上实现 11.5 FPS,在高端 GPU 上实现 107 FPS。该方法在自动内容索引、精彩检测和视频摘要等方面具有实际应用价值。未来工作将探索多模态学习,纳入音频特征和字幕,以进一步提高检测准确率。
引用
@article{arxiv.2504.09738,
title = {Automatic Detection of Intro and Credits in Video using CLIP and Multihead Attention},
author = {Vasilii Korolkov and Andrey Yanchenko},
journal= {arXiv preprint arXiv:2504.09738},
year = {2025}
}
备注
22 pages, 11 figures, submitted as a preprint. ArXiv preprint only, not submitted to a journal yet