中文

面向无监督视频摘要的判别性特征学习

计算机视觉与模式识别 2018-11-27 v1

摘要

本文研究无监督视频摘要问题,即自动从输入视频中提取关键镜头。具体而言,基于我们的经验观察,我们解决两个关键问题:(i)由于每帧输出重要性分数分布平坦导致的特征学习无效,以及(ii)处理长视频输入时的训练困难。为缓解第一个问题,我们提出一种简单而有效的正则化损失项,称为方差损失。所提方差损失使网络能够预测每帧具有高差异的输出分数,从而实现有效的特征学习并显著提升模型性能。针对第二个问题,我们设计了一种名为分块与步长网络(CSNet)的新型双流网络,利用视频特征的局部(分块)和全局(步长)时间视图。与现有方法相比,我们的CSNet对长视频给出了更好的摘要结果。此外,我们引入注意力机制以处理视频中的动态信息。我们通过大量消融研究证明了所提方法的有效性,并展示我们的最终模型在两个基准数据集上取得了新的state-of-the-art结果。

关键词

引用

@article{arxiv.1811.09791,
  title  = {Discriminative Feature Learning for Unsupervised Video Summarization},
  author = {Yunjae Jung and Donghyeon Cho and Dahun Kim and Sanghyun Woo and In So Kweon},
  journal= {arXiv preprint arXiv:1811.09791},
  year   = {2018}
}

备注

Accepted to AAAI 2019 !!!