中文

语义引导的无监督视频摘要生成

人工智能 2026-01-22 v1 多媒体

摘要

视频摘要是社会理解中的关键技术,能够高效浏览大规模多媒体内容并从社交平台提取关键信息。现有大多数无监督摘要方法依赖生成对抗网络(GANs)以增强关键帧选择并通过对抗训练生成连贯的视频摘要。然而,这些方法主要利用单模态特征,忽略了语义信息在关键帧选择中的指导作用,常常 suffer from 训练不稳定。为此,我们提出一种新颖的语义引导无监督视频摘要方法。具体地,我们设计了一种基于帧级语义对齐注意力机制,并将其集成到关键帧选择器中,将其指导Transformer-based生成器在对抗框架内更好地重建视频。此外,我们采用渐进式训练策略逐步更新模型组件,有效缓解了GANs训练的不稳定性。实验结果表明,我们的方法在多个基准数据集上实现了卓越的性能。

关键词

引用

@article{arxiv.2601.14773,
  title  = {Semantic-Guided Unsupervised Video Summarization},
  author = {Haizhou Liu and Haodong Jin and Yiming Wang and Hui Yu},
  journal= {arXiv preprint arXiv:2601.14773},
  year   = {2026}
}