从提示词到摘要:基于大语言模型和视频模型的零样本文本驱动视频摘要
计算机视觉与模式识别
2026-02-18 v3
摘要
视频数据的爆炸式增长加剧了对无需训练数据即可运行的灵活用户可控摘要工具的需求。现有方法要么依赖特定领域数据集,限制了泛化能力,要么无法融合以自然语言表达的用户意图。我们提出 Prompts-to-Summaries:首个零样本、可查询文本视频摘要器,将即插即用视频语言模型(VidLMs)的标注转化为由大语言模型(LLM)判断的用户导向视频浏览,无需使用训练数据,优于无监督方法并与需监督帧级重要性方法相比竞争。我们的管道(i)将视频分割为场景,(ii)通过内存高效的批量提示方案生成场景描述,可扩展至单块 GPU 上的数小时,(iii)通过量身定制的提示词利用 LLM 对场景重要性进行评分,(iv)通过新的一致性(时间连贯性)和唯一性(新颖性)指标将评分传递到帧,实现细粒度的帧重要性评估。在 SumMe 和 TVSum 数据集上,我们的方法超越了所有以数据为依赖的无监督方法,并在 Query-Focused Video Summarization 数据集上表现具竞争力,其中竞争方法需要监督的帧级重要性。我们发布了 VidSum-Reason,一个面向查询驱动的数据集,包含长尾概念和多步推理,其中我们的框架作为首个具有挑战性的基线。总体而言,我们展示了当预训练多模态模型通过原则化的提示策略和得分传递进行编排时,为通用、可文本查询的视频摘要提供了强大的基础。
引用
@article{arxiv.2506.10807,
title = {Prompts to Summaries: Zero-Shot Language-Guided Video Summarization with Large Language and Video Models},
author = {Mario Barbara and Alaa Maalouf},
journal= {arXiv preprint arXiv:2506.10807},
year = {2026}
}