中文

用于视频摘要的重建式序列-图网络

计算机视觉与模式识别 2021-05-11 v1 人工智能

摘要

利用镜头内与镜头间的依赖关系对于基于关键镜头的视频摘要至关重要。当前方法主要通过循环神经网络将视频建模为帧序列。然而,序列模型的一个潜在局限是它们侧重于捕捉局部邻域依赖,而长距离中的高阶依赖未被充分挖掘。一般而言,每个镜头中的帧记录某一活动并随时间平滑变化,但多跳关系频繁出现于镜头之间。在此情形下,局部与全局依赖对于理解视频内容均十分重要。受此启发,我们提出一种重建式序列-图网络(RSGN),将帧与镜头分层编码为序列与图,其中帧级依赖由长短期记忆(LSTM)编码,镜头级依赖由图卷积网络(GCN)捕捉。随后,通过利用镜头间的局部与全局依赖对视频进行摘要。此外,我们设计了一个重建器来奖励摘要生成器,使得生成器能以无监督方式优化,从而规避视频摘要中标注数据的缺乏。进而,在重建损失指导下,预测摘要能更好地保留主要视频内容与镜头级依赖。实际上,在 SumMe、TVsum 和 VTW 三个流行数据集上的实验结果已证明了我们所提方法在摘要任务上的优越性。

关键词

引用

@article{arxiv.2105.04066,
  title  = {Reconstructive Sequence-Graph Network for Video Summarization},
  author = {Bin Zhao and Haopeng Li and Xiaoqiang Lu and Xuelong Li},
  journal= {arXiv preprint arXiv:2105.04066},
  year   = {2021}
}

备注

Accepted by IEEE TPAMI 2021