中文

基于 Gershgorin 圆对齐的图展开与抽样用于瞬时视频摘要

计算机视觉与模式识别 2024-08-06 v1 图像与视频处理 信号处理

摘要

用户从移动设备上传到 YouTube 和 TikTok 等社交媒体网站的视频 (UGV) 短小且非重复。我们通过基于 Gershgorin 圆对齐 (GDA) 的快速图抽样,将瞬时 UGV 汇总为几个关键帧,时间复杂度为线性。具体而言,我们首先将 UG 中的 NN 个帧序列建模为 MM 跳路径图 Go\mathcal{G}^o(其中 MNM \ll N),其中两个帧在 MM 个时间瞬间内的相似性编码为基于特征相似性的正边。为了高效抽样,我们然后通过两种可证明性能界限的图展开程序之一,将 Go\mathcal{G}^o 展开为 11 跳路径图 G\mathcal{G},指定为广义图拉普拉斯矩阵 L\mathcal{L}。我们表明,最大化系数矩阵 B=diag(h)+μL\mathbf{B} = \textit{diag}\left(\mathbf{h}\right) + \mu \mathcal{L} 的最小特征值 λmin(B)\lambda_{\min}\left(\mathbf{B}\right)(其中 h\mathbf{h} 为二进制关键帧选择向量)等价于最小化最坕情况信号重构误差。我们通过为所有图节点(帧)迭代对齐 Gershgorin 圆左端点来最大化 GCT 下界 λmin(B)\lambda^-_{\min}\left(\mathbf{B}\right)。在多个短视频数据集上进行的大量实验表明,本算法在显著降低复杂度的同时,实现了与或优于当前方法的视频摘要性能。

关键词

引用

@article{arxiv.2408.01859,
  title  = {Graph Unfolding and Sampling for Transitory Video Summarization via Gershgorin Disc Alignment},
  author = {Sadid Sahami and Gene Cheung and Chia-Wen Lin},
  journal= {arXiv preprint arXiv:2408.01859},
  year   = {2024}
}

备注

13 pages, 5 figures