基于多模态预训练特征的电影预告片类型分类
计算机视觉与模式识别
2024-10-29 v1 人工智能
多媒体
图像与视频处理
摘要
我们引入了一种新方法,用于电影类型分类,充分利用了多样化的可获取预训练模型。这些模型提取与视觉景观、物体、人物、文本、语音、音乐和音效相关的高级特征。为了智能地融合这些预训练特征,我们训练小型分类器模型,具有低时间和内存要求。采用transformer模型,我们的方法利用电影预告片中所有视频和音频帧,却不进行任何时间池化,高效地利用所有元素之间的对应关系,与传统方法通常使用的固定且较少帧数不同。我们的做法融合来自不同任务和模态的特征,这些特征具有不同的维度、不同的时间长度以及复杂的依赖关系,与当前方法不同。我们的方法在精确率、召回率和平均精度(mAP)方面均优于当前最先进的电影类型分类模型。为促进未来研究,我们公开了整个MovieNet数据集的预训练特征,以及我们的类型分类代码和训练好的模型。
关键词
引用
@article{arxiv.2410.19760,
title = {Movie Trailer Genre Classification Using Multimodal Pretrained Features},
author = {Serkan Sulun and Paula Viana and Matthew E. P. Davies},
journal= {arXiv preprint arXiv:2410.19760},
year = {2024}
}