SummDiff:基于扩散模型的视频摘要生成
机器学习
2025-10-10 v1
摘要
视频摘要是通过选择视频子集来缩短视频长度,同时保留其关键时刻的任务。尽管该任务本质上具有主观性,但以往工作倾向于确定性地回归多个评审者的平均帧得分,忽略了构成优质摘要的内在主观性。我们提出一种新颖问题表述,将视频摘要建模为条件生成任务,使模型能够学习优质摘要的分布,并生成多个符合人类不同观点意见的摘要。首次采用扩散模型于视频摘要,我们提出的方法SummDiff能够动态适应视觉上下文,基于输入视频生成多个候选摘要。大量实验表明,SummDiff不仅在各种基准测试上实现了最先进的性能,还能生成与单个评审者偏好高度吻合的摘要。此外,我们提供了更深层次的洞见,通过分析小背包问题(knapsack),这一重要最后一步在评估中长期被忽视,提出了新的指标。
引用
@article{arxiv.2510.08458,
title = {SummDiff: Generative Modeling of Video Summarization with Diffusion},
author = {Kwanseok Kim and Jaehoon Hahm and Sumin Kim and Jinhwan Sul and Byunghak Kim and Joonseok Lee},
journal= {arXiv preprint arXiv:2510.08458},
year = {2025}
}