中文

基于去噪扩散概率模型的视频摘要生成

计算机视觉与模式识别 2024-12-13 v2

摘要

视频摘要旨在消除视频中的冗余视觉信息,同时保留关键部分,以构建简洁且全面的视频概要。大多数现有方法使用判别模型预测视频帧的重要性得分。然而,这些方法容易受到来自不同标注者对同一视频标注不一致性的影响。本文引入了来自概率分布视角生成式框架,用于视频摘要生成,有效减少了主观标注噪声的干扰。具体而言,我们提出了一种基于去噪扩散概率模型(DDPM)的新颖扩散摘要方法,该方法通过噪声预测学习训练数据的概率分布,并通过迭代去噪生成摘要。我们的方法对主观标注噪声更不敏感,比判别方法更不易过拟合训练数据,具有强大的泛化能力。此外,为便于在有限数据上训练 DDPM,我们采用无监督视频摘要模型实现较早的去噪过程。在多个数据集(TVSum、SumMe 和 FPVSum)上的大量实验表明,我们的方法有效。

关键词

引用

@article{arxiv.2412.08357,
  title  = {Video Summarization using Denoising Diffusion Probabilistic Model},
  author = {Zirui Shang and Yubo Zhu and Hongxi Li and Shuo Yang and Xinxiao Wu},
  journal= {arXiv preprint arXiv:2412.08357},
  year   = {2024}
}

备注

Accepted by AAAI2025