中文

基于卷积注意力对抗网络的无监督视频摘要

计算机视觉与模式识别 2021-05-25 v1 多媒体

摘要

随着视频数据的爆炸式增长,视频摘要试图寻找最小的帧子集同时仍能传达主要故事,已成为最热门的话题之一。如今,监督学习技术尤其是深度学习出现后已取得大量成果。然而,为大规模视频数据集收集人类标注极其昂贵且困难。为解决此问题,我们提出一种卷积注意力对抗网络(CAAN),其关键思想是以无监督方式构建深度摘要器。在生成对抗网络基础上,我们的整体框架由生成器和判别器组成。前者预测视频所有帧的重要性分数,而后者试图区分分数加权的帧特征与原始帧特征。具体而言,生成器采用全卷积序列网络提取视频的全局表示,并采用基于注意力的网络输出归一化重要性分数。为学习参数,我们的目标函数由三个损失函数组成,可协同指导帧级重要性分数预测。为验证所提方法,我们在 SumMe 和 TVSum 两个公开基准上进行了大量实验。结果表明所提方法优于其他最先进的无监督方法。我们的方法甚至优于一些已发布的监督方法。

关键词

引用

@article{arxiv.2105.11131,
  title  = {Unsupervised Video Summarization with a Convolutional Attentive Adversarial Network},
  author = {Guoqiang Liang and Yanbing Lv and Shucheng Li and Shizhou Zhang and Yanning Zhang},
  journal= {arXiv preprint arXiv:2105.11131},
  year   = {2021}
}