中文

用于通用视频摘要的膨胀时间关系对抗网络

计算机视觉与模式识别 2019-09-17 v2

摘要

每天涌现的大量视频使得在极短时间内提取并理解视频中的关键信息变得愈发关键。视频摘要旨在寻找能够传达给定视频完整故事的最小帧子集,因此对提高视频理解的效率具有重要意义。我们提出了一种新颖的膨胀时间关系生成对抗网络(Dilated Temporal Relational Generative Adversarial Network, DTR-GAN)来实现帧级视频摘要。给定一段视频,它会选择包含最有意义且最紧凑信息的帧集合。具体而言,DTR-GAN 以对抗方式学习一个膨胀时间关系生成器和一个具有三人博弈损失的判别器。引入了新的膨胀时间关系(DTR)单元以增强时间表示的捕获能力。生成器利用该单元有效利用全局多尺度时间上下文来选择关键帧,并补充常用的 Bi-LSTM。为了确保摘要从全局视角捕获足够的视频关键表示,而非简单的随机缩短序列,我们提出了一个判别器,通过三人博弈损失学习强制执行摘要的信息完整性和紧凑性。该损失包括生成摘要损失、随机摘要损失和真实摘要(ground-truth)损失,它们在更好地正则化学习模型以获取有用摘要方面发挥着重要作用。在三个公开数据集上的综合实验证明了所提方法的有效性。

关键词

引用

@article{arxiv.1804.11228,
  title  = {Dilated Temporal Relational Adversarial Network for Generic Video Summarization},
  author = {Yujia Zhang and Michael Kampffmeyer and Xiaodan Liang and Dingwen Zhang and Min Tan and Eric P. Xing},
  journal= {arXiv preprint arXiv:1804.11228},
  year   = {2019}
}