编辑视频与原始视频摘要的通用框架
计算机视觉与模式识别
2019-04-25 v1
摘要
本文构建了一个同时适用于编辑视频与原始视频摘要的通用摘要框架。总体而言,我们的工作可分为三方面:1) 设计了四个模型以捕捉视频摘要的属性,即包含重要人物与物体(重要性)、对视频内容具有代表性(代表性)、无相似关键镜头(多样性)以及故事线的流畅性(故事性)。具体地,这些模型适用于编辑视频与原始视频。2) 构建了由上述四个模型加权组合而成的综合评分函数。注意,评分函数中四个模型的权重(记为属性权重)以有监督方式学习。此外,属性权重分别针对编辑视频与原始视频学习。3) 训练集由编辑视频与原始视频共同构建,以弥补训练数据的不足。特别地,每个训练视频配备一对混合系数,可降低由粗略混合引起的训练集结构混乱。我们在三个数据集(包括编辑视频、短原始视频与长原始视频)上测试了我们的框架。实验结果验证了所提框架的有效性。
引用
@article{arxiv.1904.10669,
title = {A General Framework for Edited Video and Raw Video Summarization},
author = {Xuelong Li and Bin Zhao and Xiaoqiang Lu},
journal= {arXiv preprint arXiv:1904.10669},
year = {2019}
}