基于层次 Transformer 的视频联合建模用于协同摘要
计算机视觉与模式识别
2022-06-30 v2
摘要
视频摘要旨在自动生成视频的摘要(故事板或视频略读),从而有助于大规模视频检索与浏览。现有多数方法对单个视频进行视频摘要,忽略了相似视频间的相关性。然而,此类相关性对视频理解与视频摘要同样具有信息价值。为克服该局限,我们提出基于层次 Transformer 的视频联合建模(VJMHT)用于协同摘要,其考虑了跨视频的语义依赖。具体而言,VJMHT 由两层 Transformer 组成:第一层从相似视频的各个镜头中提取语义表示,第二层执行镜头级视频联合建模以聚合跨视频语义信息。借此,完整的跨视频高层模式被显式建模并学习用于单个视频的摘要。此外,引入基于 Transformer 的视频表示重建以最大化摘要与原视频之间的高层相似度。我们进行了大量实验来验证所提模块的有效性以及 VJMHT 在 F-measure 与基于排序的评估方面的优越性。
关键词
引用
@article{arxiv.2112.13478,
title = {Video Joint Modelling Based on Hierarchical Transformer for Co-summarization},
author = {Li Haopeng and Ke Qiuhong and Gong Mingming and Zhang Rui},
journal= {arXiv preprint arXiv:2112.13478},
year = {2022}
}