基于 Gershgorin 圆对齐的图展开与抽样用于瞬时视频摘要
计算机视觉与模式识别
2024-08-06 v1 图像与视频处理
信号处理
摘要
用户从移动设备上传到 YouTube 和 TikTok 等社交媒体网站的视频 (UGV) 短小且非重复。我们通过基于 Gershgorin 圆对齐 (GDA) 的快速图抽样,将瞬时 UGV 汇总为几个关键帧,时间复杂度为线性。具体而言,我们首先将 UG 中的 个帧序列建模为 跳路径图 (其中 ),其中两个帧在 个时间瞬间内的相似性编码为基于特征相似性的正边。为了高效抽样,我们然后通过两种可证明性能界限的图展开程序之一,将 展开为 跳路径图 ,指定为广义图拉普拉斯矩阵 。我们表明,最大化系数矩阵 的最小特征值 (其中 为二进制关键帧选择向量)等价于最小化最坕情况信号重构误差。我们通过为所有图节点(帧)迭代对齐 Gershgorin 圆左端点来最大化 GCT 下界 。在多个短视频数据集上进行的大量实验表明,本算法在显著降低复杂度的同时,实现了与或优于当前方法的视频摘要性能。
关键词
引用
@article{arxiv.2408.01859,
title = {Graph Unfolding and Sampling for Transitory Video Summarization via Gershgorin Disc Alignment},
author = {Sadid Sahami and Gene Cheung and Chia-Wen Lin},
journal= {arXiv preprint arXiv:2408.01859},
year = {2024}
}
备注
13 pages, 5 figures