SD-VSum:一种用于脚本驱动视频摘要的方法与数据集
计算机视觉与模式识别
2025-09-23 v2 人工智能
多媒体
摘要
在这项工作中,我们引入了脚本驱动视频摘要这一任务,其目标是通过选择与用户提供的、概述所需摘要视觉内容的脚本最相关的部分,生成长视频的摘要。随后,我们扩展了一个最近引入的用于通用视频摘要的大规模数据集(VideoXum),为每个视频可用的不同人工标注摘要生成了自然语言描述。通过这种方式,我们使其与所引入的任务兼容,因为可用的“视频、摘要和摘要描述”三元组可用于训练一种方法,该方法能够根据提供的关于每个摘要内容的脚本,为给定视频生成不同的摘要。最后,我们为脚本驱动视频摘要开发了一种新的网络架构(SD-VSum),该架构采用跨模态注意力机制来对齐和融合来自视觉和文本模态的信息。我们的实验评估证明了 SD-VSum 相对于文献中查询驱动和通用(单模态和多模态)摘要的 SOTA 方法的先进性能,并证明了其能够生成适应每个用户内容需求的视频摘要的能力。
引用
@article{arxiv.2505.03319,
title = {SD-VSum: A Method and Dataset for Script-Driven Video Summarization},
author = {Manolis Mylonas and Evlampios Apostolidis and Vasileios Mezaris},
journal= {arXiv preprint arXiv:2505.03319},
year = {2025}
}
备注
In ACM Multimedia 2025, DOI:10.1145/3746027.3755821