MovieCLIP:电影中的视觉场景识别
计算机视觉与模式识别
2022-10-25 v2 计算与语言
多媒体
摘要
电影等长形式媒体具有复杂的叙事结构,事件跨越丰富多样的 ambient 视觉场景。电影中视觉场景相关的领域特定挑战包括转场、人物覆盖以及广泛的现实与虚构情景。现有的电影视觉场景数据集分类法有限,且未考虑电影片段内的视觉场景转场。本工作中,我们通过首先自动构建源自电影脚本与辅助网络视频数据集的、包含179个场景标签的崭新且广泛的电影中心分类法,来解决电影中视觉场景识别问题。我们不使用可能昂贵的手动标注,而是利用CLIP基于所提分类法对来自32K电影片段的112万镜头进行弱标注。我们提供在称为MovieCLIP的弱标注数据集上训练的基线视觉模型,并在由人工评分者验证的独立数据集上评估它们。我们表明,利用在MovieCLIP上预训练模型的特征有益于下游任务,如网络视频与电影预告片的多标签场景与类型分类。
引用
@article{arxiv.2210.11065,
title = {MovieCLIP: Visual Scene Recognition in Movies},
author = {Digbalay Bose and Rajat Hebbar and Krishna Somandepalli and Haoyang Zhang and Yin Cui and Kree Cole-McLaughlin and Huisheng Wang and Shrikanth Narayanan},
journal= {arXiv preprint arXiv:2210.11065},
year = {2022}
}
备注
Accepted to 2023 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV 2023). Project website with supplemental material: https://sail.usc.edu/~mica/MovieCLIP/. Revised version with updated author affiliations