用于视频摘要的脉冲变分图表示推理
计算机视觉与模式识别
2025-08-22 v1
摘要
随着短视频内容的兴起,用于提取关键信息的高效视频摘要技术变得至关重要。然而,现有方法难以捕捉全局时间依赖关系并保持视频内容的语义连贯性。此外,这些方法在多通道特征融合过程中也受到噪声的影响。我们提出了一种脉冲变分图(SpiVG)网络,该网络增强了信息密度并降低了计算复杂度。首先,我们设计了一个基于脉冲神经网络(SNN)的关键帧提取器,利用SNN的事件驱动计算机制自主地学习关键帧特征。为了实现跨视频帧的细粒度和自适应推理,我们引入了一个动态聚合图推理器,它将上下文对象一致性与语义视角连贯性解耦。我们提出了一个变分推理重构模块,以解决多通道特征融合过程中出现的不确定性和噪声。在该模块中,我们采用证据下界优化(ELBO)来捕捉多通道特征分布的潜在结构,并使用后验分布正则化来减少过拟合。实验结果表明,SpiVG在SumMe、TVSum、VideoXum和QFVS等多个数据集上超越了现有方法。我们的代码和预训练模型可在https://github.com/liwrui/SpiVG获取。
引用
@article{arxiv.2508.15389,
title = {Spiking Variational Graph Representation Inference for Video Summarization},
author = {Wenrui Li and Wei Han and Liang-Jian Deng and Ruiqin Xiong and Xiaopeng Fan},
journal= {arXiv preprint arXiv:2508.15389},
year = {2025}
}
备注
Accepted by IEEE TIP