基于成对时间关系的全局多样性注意力视频摘要方法
计算机视觉与模式识别
2020-09-24 v1 多媒体
摘要
视频摘要是便利视频检索与浏览的有效手段。现有多数系统采用基于编码器-解码器的循环神经网络,既未能显式地使系统生成的摘要帧多样化,又需要密集计算。本文提出一种高效的卷积神经网络架构,用于通过全局多样性注意力实现视频摘要(SUM-GDA),该架构从全局视角适配注意力机制以考量视频帧的成对时间关系。具体而言,GDA 模块具有两方面优势:1)它对成对帧内部的关系以及所有成对间的关系进行建模,从而捕获单段视频所有帧上的全局注意力;2)它反映每帧对整个视频的重要性,进而在这些帧上产生多样性注意力。因此,SUM-GDA 有利于生成多样化帧以形成令人满意的视频摘要。在 SumMe、TVSum 和 VTW 三个数据集上的大量实验表明,SUM-GDA 及其扩展以显著优势优于其他竞争的 SOTA 方法。此外,所提模型可并行运行且计算开销大幅降低,有助于在极高要求的应用中部署。
引用
@article{arxiv.2009.10942,
title = {Exploring global diverse attention via pairwise temporal relation for video summarization},
author = {Ping Li and Qinghao Ye and Luming Zhang and Li Yuan and Xianghua Xu and Ling Shao},
journal= {arXiv preprint arXiv:2009.10942},
year = {2020}
}
备注
12 pages, 8 figures