基于主体中心视角的镜头类型分类统一框架
计算机视觉与模式识别
2020-08-11 v1 机器学习
多媒体
图像与视频处理
摘要
镜头是各类视频(如电影、电视剧以及互联网上蓬勃发展的用户生成视频)的关键叙事元素。镜头类型极大影响底层思想、情感与信息的表达。分析镜头类型的技术对于视频理解十分重要,在当下时代其现实应用需求日益增长。由于除视频内容外还需额外信息(如帧的空间构图与摄像机运动),镜头类型分类颇具挑战。为解决这些问题,我们提出一种用于镜头类型识别的学习框架——主体引导网络(Subject Guidance Network, SGNet)。SGNet 将镜头的主体与背景分离为两条流,分别作为尺度与运动类型分类的引导图。为便于镜头类型分析与模型评估,我们构建了大规模数据集 MovieShots,包含来自 7K 部电影预告片的 46K 个镜头,标注了其尺度与运动类型。实验表明,我们的框架能够准确识别镜头的这两个属性,优于以往所有方法。
引用
@article{arxiv.2008.03548,
title = {A Unified Framework for Shot Type Classification Based on Subject Centric Lens},
author = {Anyi Rao and Jiaze Wang and Linning Xu and Xuekun Jiang and Qingqiu Huang and Bolei Zhou and Dahua Lin},
journal= {arXiv preprint arXiv:2008.03548},
year = {2020}
}
备注
ECCV2020. Project page: https://anyirao.com/projects/ShotType.html