MHSCNet:一种用于视频摘要的多模态层次镜头感知卷积网络
计算机视觉与模式识别
2023-05-31 v3
摘要
视频摘要旨在通过有效捕获并组合整个内容中最具信息量的部分来生成简洁的视频摘要。现有的视频摘要方法将该任务视为逐帧关键帧选择问题,通常通过结合长程时间依赖与单模态或双模态信息来构建逐帧表示。然而,最优视频摘要需要反映最具价值的自身信息关键帧,以及具有整体内容语义能力的关键帧。因此,构建更强大且鲁棒的逐帧表示并以公平且全面的方式预测帧级重要性得分至关重要。为解决上述问题,我们提出一种多模态层次镜头感知卷积网络,记为 MHSCNet,通过结合可用的综合多模态信息来增强逐帧表示。具体而言,我们设计了一种层次化 ShotConv 网络,通过考虑短程与长程时间依赖来融入自适应镜头感知帧级表示。基于学习到的镜头感知表示,MHSCNet 能从视频的局部与全局视角预测帧级重要性得分。在两个标准视频摘要数据集上的大量实验表明,我们所提方法持续优于最先进的基线。源代码将公开可用。
引用
@article{arxiv.2204.08352,
title = {MHSCNet: A Multimodal Hierarchical Shot-aware Convolutional Network for Video Summarization},
author = {Wujiang Xu and Runzhong Wang and Xiaobo Guo and Shaoshuai Li and Qiongxu Ma and Yunan Zhao and Sheng Guo and Zhenfeng Zhu and Junchi Yan},
journal= {arXiv preprint arXiv:2204.08352},
year = {2023}
}