中文

局部多样性有多局部?以动态基集增强序列行列式点过程用于监督视频摘要

计算机视觉与模式识别 2018-08-27 v4

摘要

海量的视频内容和高频的观看需求催生了自动视频摘要算法,其一个关键特性是建模多样性的能力。如果视频像长达数小时的自我中心视频那样冗长,则有必要跟踪视频的时间结构并施加局部多样性。局部多样性指的是从短时间片段中选取的镜头是多样的,但如果视觉相似的镜头在视频中相隔较远,则允许其共存在于摘要中。在本文中,我们提出一种构建于SeqDPP之上的新颖概率模型,以动态控制施加局部多样性的视频片段的时间跨度。特别地,我们使SeqDPP能够学习从输入视频中自动推断局部多样性应当有多局部。所得模型通过标志性的最大似然估计(MLE)进行训练极为复杂,且进一步受限于暴露偏差和不可微的评估指标。为解决这些问题,我们转而设计了一种强化学习算法来训练所提模型。大量实验验证了我们的模型及新学习算法相对于基于MLE方法的优势。

关键词

引用

@article{arxiv.1807.04219,
  title  = {How Local is the Local Diversity? Reinforcing Sequential Determinantal Point Processes with Dynamic Ground Sets for Supervised Video Summarization},
  author = {Yandong Li and Liqiang Wang and Tianbao Yang and Boqing Gong},
  journal= {arXiv preprint arXiv:1807.04219},
  year   = {2018}
}