TRIM: 一种最大化时序相对信息和代表性的自监督视频摘要框架
计算机视觉与模式识别
2026-05-05 v2
摘要
视频内容的日益普及以及对高效获取有意义信息的日益增长的需求,使视频摘要和视频高亮成为一个至关重要的研究领域。然而,许多最先进的方法严重依赖监督性标注或基于注意力的模型,这些模型在分布迁移面前计算昂贵且脆弱,阻碍了跨数据集的跨域适用性。我们引入了一个开创性的自监督视频摘要模型,能够在不依赖注意力、RNN 或变换器的情况下捕捉空间和时序依赖关系。我们的框架集成了新颖的马尔可夫过程驱动的损失指标和两个阶段的自监督学习范式,确保性能和效率。我们的方法在 SUMME 和 TVSUM 数据集上实现了最先进的性能,超越了所有现有的无监督方法,也与最好的监督模型一汰,展示了高效、无标注架构的潜力。这为更通用的视频摘要技术铺平了道路,挑战了对复杂架构的依赖。
引用
@article{arxiv.2506.20588,
title = {TRIM: A Self-Supervised Video Summarization Framework Maximizing Temporal Relative Information and Representativeness},
author = {Pritam Mishra and Coloma Ballester and Dimosthenis Karatzas},
journal= {arXiv preprint arXiv:2506.20588},
year = {2026}
}