中文

基于上下文感知的零样本视频摘要伪标签评分

计算机视觉与模式识别 2025-10-23 v3 人工智能

摘要

我们提出一种引导评级、带伪标签且以提示为导向的零样本视频摘要框架,桥接大型语言模型与结构化语义推理。将小部分人工标注转换为高置信度伪标签,并组织为数据自适应评级,定义清晰的评估维度,如主题相关性、动作细节和叙事进程。推理期间,边界场景(包括开头和结尾段落)基于各自描述独立评分,而中间场景则整合相邻片段的简要摘要,以评估叙事连续性和冗余性。该设计使语言模型能够在无需参数调优的情况下平衡局部显著性与全局连贯性。跨越三个基准测试,本方法实现了稳定且具竞争力的结果,在 SumMe 上获得 57.58 的 F1 分数,在 TVSum 上获得 63.05,在 QFVS 上获得 53.79,分别超越零样本基线 +0.85、+0.84 和 +0.37。这些结果表明,评级引导的伪标签化与上下文提示结合有效稳定了基于语言模型的评分,建立了一个通用、可解释且无需训练的范式,适用于通用视频摘要和查询聚焦视频摘要。

关键词

引用

@article{arxiv.2510.17501,
  title  = {Context-Aware Pseudo-Label Scoring for Zero-Shot Video Summarization},
  author = {Yuanli Wu and Long Zhang and Yue Du and Bin Li},
  journal= {arXiv preprint arXiv:2510.17501},
  year   = {2025}
}