中文

基于自注意力生成对抗网络的无监督视频摘要

计算机视觉与模式识别 2023-07-18 v1

摘要

本文中,我们研究遵循无监督方法生成全面视频摘要的问题,该方法依赖于对抗学习。我们基于一种流行方法构建,其中训练生成对抗网络(GAN)以创建具有代表性的摘要,使其与原始摘要无法区分。将注意力机制引入用于视频帧选择、编码和解码的架构中,显示了自注意力与 transformer 在建模视频摘要时间关系上的有效性。我们提出 SUM-GAN-AED 模型,其使用自注意力机制进行帧选择,并结合 LSTM 进行编码与解码。我们在 SumMe、TVSum 和 COGNIMUSE 数据集上评估 SUM-GAN-AED 模型的性能。实验结果表明,使用自注意力机制作为帧选择机制在 SumMe 上优于当前最优方法,并在 TVSum 和 COGNIMUSE 上取得与当前最优相当的性能。

关键词

引用

@article{arxiv.2307.08145,
  title  = {Self-Attention Based Generative Adversarial Networks For Unsupervised Video Summarization},
  author = {Maria Nektaria Minaidi and Charilaos Papaioannou and Alexandros Potamianos},
  journal= {arXiv preprint arXiv:2307.08145},
  year   = {2023}
}