中文

ERA:基于 Wasserstein GAN 的实体关系感知视频摘要方法

计算机视觉与模式识别 2021-09-07 v1

摘要

视频摘要旨在通过生成简洁、简短的摘要来简化大规模视频浏览,这些摘要偏离但能很好地代表原始视频。由于视频标注的稀缺,近期视频摘要的进展集中于无监督方法,其中基于 GAN 的方法最为普遍。此类方法包含一个摘要器和一个判别器。仅当从该摘要重建的视频不能被判别器与原始视频区分时,摘要器生成的视频才被当作最终输出。这类基于 GAN 方法的主要问题有两点。首先,以此方式得到的摘要视频是原始视频中具有低冗余且包含高优先级事件/实体的子集。该摘要准则并不充分。其次,GAN 框架的训练不稳定。本文提出一种新颖的实体关系感知视频摘要方法(ERA)以解决上述问题。具体而言,我们引入对抗时空网络来构建实体间关系,我们认为该关系在摘要中也应被赋予高优先级。GAN 训练问题通过引入 Wasserstein GAN 以及两个新提出的视频块/分数和损失得以解决。此外,分数和损失还能缓解模型对变化视频长度的敏感性,这是当前大多数视频分析任务的固有问题。我们的方法在目标基准数据集上大幅提升了性能,并超越了当前排行榜第一的 SOTA CSNet(在 TVSum 上 F1 分数提升 2.1%,在 SumMe 上 F1 分数提升 3.1%)。我们希望这种直截了当却有效的方法能为未来无监督视频摘要研究提供一些启发。

关键词

引用

@article{arxiv.2109.02625,
  title  = {ERA: Entity Relationship Aware Video Summarization with Wasserstein GAN},
  author = {Guande Wu and Jianzhe Lin and Claudio T. Silva},
  journal= {arXiv preprint arXiv:2109.02625},
  year   = {2021}
}

备注

8 pages, 3 figures