基于语言增强与镜头采样的电影类型分类
计算机视觉与模式识别
2023-11-09 v2
摘要
基于视频的电影类型分类因在推荐系统中的多种应用而受到相当关注。先前工作通常通过调整传统视频分类任务(如动作识别或事件检测)模型来解决该任务。然而,这些模型常忽略视频中存在的语言元素(如旁白或对话),其可隐式传达电影类型的高层语义,如情节或背景语境。此外,现有方法主要设计用于编码输入视频的全部内容,导致预测电影类型效率低下。电影类型预测可能仅需少数镜头即可准确判定类型,无需全面理解整段视频。为应对这些挑战,我们提出一种基于语言增强与镜头采样的电影类型分类方法(Movie-CLIP)。Movie-CLIP主要由两部分组成:从输入音频中识别语言元素的语言增强模块,以及从整段视频中选取代表性镜头的镜头采样模块。我们在MovieNet与Condensed Movies数据集上评估该方法,平均精度均值(mAP)较基线提升约6–9%。我们还将Movie-CLIP推广至场景边界检测任务,平均精度(AP)较最先进方法提升1.1%。我们在github.com/Zhongping-Zhang/Movie-CLIP发布实现代码。
引用
@article{arxiv.2203.13281,
title = {Movie Genre Classification by Language Augmentation and Shot Sampling},
author = {Zhongping Zhang and Yiwen Gu and Bryan A. Plummer and Xin Miao and Jiayi Liu and Huayan Wang},
journal= {arXiv preprint arXiv:2203.13281},
year = {2023}
}
备注
Accepted at WACV2024